daun.pw

Qué GPU NVIDIA RTX necesitas para IA en local

· 11 min de lectura · 2401 palabras

Qué mirar de verdad en una gráfica para ejecutar modelos de IA en casa: VRAM antes que potencia, diferencias entre generaciones y qué caso de uso pide cada una.

Elegir una GPU NVIDIA RTX para IA local se reduce, casi siempre, a una sola cifra: los gigas de VRAM. Los núcleos CUDA, la generación y la frecuencia influyen en lo rápido que va, pero la VRAM decide algo más básico, que es si el modelo arranca o no. En esta guía tienes cómo traducir lo que quieres hacer en gigas concretos, qué cambia entre generaciones y en qué momento gastar más deja de compensar.

La VRAM manda sobre todo lo demás

Memoria de vídeo de varias generaciones de gráficas RTX
Memoria de vídeo de varias generaciones de gráficas RTX

Un modelo de IA se ejecuta cargando sus pesos en la memoria de la gráfica. Si los pesos caben, la tarjeta trabaja a su ritmo. Si no caben, pasa una de dos cosas: el programa se cae con un error de memoria, o reparte parte del modelo en la RAM del sistema y lo mueve por el bus PCIe cada vez que lo necesita. Esa segunda opción funciona, pero el rendimiento se hunde. No es un poco más lento: es la diferencia entre leer la respuesta según se escribe y esperar mirando el techo.

De ahí sale la regla que ordena toda la compra: una tarjeta más lenta con más VRAM le gana casi siempre a una tarjeta más rápida que no puede cargar el modelo. La potencia bruta mejora los segundos por imagen o los tokens por segundo. La VRAM decide qué modelos existen para ti y cuáles no.

Hay una segunda razón, menos evidente. En generación de texto, la velocidad depende sobre todo del ancho de banda de la memoria, no de la capacidad de cálculo. La tarjeta pasa el rato leyendo pesos de la VRAM una y otra vez. Por eso dos tarjetas con la misma memoria pero distinto bus se comportan diferente, y por eso las cifras de teraflops de las fichas técnicas explican menos de lo que parece.

Cuánta VRAM pide cada tarea

Qué puedes ejecutar según la memoria que tengas
Qué puedes ejecutar según la memoria que tengas

La cuenta rápida para un modelo de lenguaje es esta: multiplica los miles de millones de parámetros por los bytes que ocupa cada uno según la precisión.

A ese número súmale margen. El contexto (la ventana de conversación) se guarda en la caché KV y crece con la longitud, así que un contexto largo puede añadir varios gigas por su cuenta. Cuenta un 20 o 25 por ciento extra sobre el tamaño del modelo y no te llevarás sustos.

Lo que quieres hacer VRAM cómoda
Modelo de lenguaje de 7-8B en 4 bits 8 GB
Modelo de 13-14B en 4 bits 12 GB
Modelo de 30-32B en 4 bits 24 GB
Modelo de 70B en 4 bits 48 GB o reparto entre tarjetas
Generación de imagen con SDXL 8-12 GB
Modelos de imagen modernos tipo Flux, cuantizados 12-16 GB
Transcripción con Whisper en su versión grande 8-10 GB
Ajuste fino ligero (LoRA) de un modelo de 7B 16-24 GB
Generación de vídeo 24 GB y subiendo

Si quieres el desglose por familias de modelos y no por tareas, lo tienes en la tabla práctica de VRAM por modelo, que va modelo a modelo.

Qué cambia entre RTX 30, RTX 40 y RTX 50

Las tres generaciones de consumo que te vas a encontrar hoy sirven para IA local. La diferencia está en eficiencia, formatos numéricos soportados y, otra vez, memoria.

Generación Arquitectura Lo relevante para IA
RTX 30 Ampere Tensor cores con FP16 y BF16. Sin FP8. Consumo alto para lo que rinde. La RTX 3090 con 24 GB es la vía más asequible a mucha VRAM si la buscas de segunda mano
RTX 40 Ada Lovelace Añade FP8 en los tensor cores y mejora bastante el rendimiento por vatio. La 4090 mantiene 24 GB
RTX 50 Blackwell Añade soporte nativo de FP4 y memoria GDDR7, más rápida. La 5090 sube a 32 GB, el primer salto real de capacidad en varias generaciones

Un matiz honesto sobre los formatos nuevos: que la tarjeta soporte FP4 o FP8 no significa que tu software lo aproveche. La mayoría de la gente ejecuta modelos cuantizados con llama.cpp o herramientas construidas encima, y esas rutas usan sus propios formatos enteros que funcionan igual en las tres generaciones. El beneficio de FP4 llega cuando el motor de inferencia lo implementa. Compra pensando en gigas, no en siglas de la nota de prensa.

Tarjeta por tarjeta, ordenadas por memoria

Tarjeta VRAM Para qué llega
RTX 3060 12 GB 12 GB La entrada más sensata de segunda mano. Modelos de 7-8B cómodos, SDXL justo pero viable
RTX 4060 Ti 16 GB 16 GB Mucha memoria para su gama, pero con un bus estrecho que la deja lenta en cargas grandes
RTX 4070 12 GB Equilibrada. Se queda corta si te da por los modelos de 30B
RTX 5070 12 GB Misma lógica que la anterior, con arquitectura más nueva
RTX 4070 Ti Super / 5070 Ti 16 GB El punto dulce actual para la mayoría de la gente
RTX 4080 / 5080 16 GB Rápidas, pero pagas potencia que la VRAM no te deja explotar del todo
RTX 3090 24 GB La rareza útil: vieja, tragona, y aun así te abre modelos que una 5080 no puede cargar
RTX 4090 24 GB Techo cómodo. Rápida y con memoria de sobra para casi todo lo doméstico
RTX 5090 32 GB La única de consumo que entra en modelos de 30B con contexto largo sin apretar

Fíjate en el patrón. La 3090 y la 5080 están separadas por dos generaciones y la vieja gana en lo único que bloquea de verdad. Si el resto de la máquina te lo permite, ese es el criterio. Cómo montar ese resto (fuente, caja, ventilación, CPU) lo cuento en la guía de qué priorizar al montar un PC para IA en local.

Qué pasa de verdad cuando no cabe

Merece la pena entender el fallo antes de comprar, porque marca dónde está tu límite real.

Con modelos de lenguaje, herramientas como Ollama o llama.cpp reparten capas: las que caben van a la GPU y el resto se queda en la CPU. El modelo funciona, responde y no se cae. Pero cada token tiene que pasar por la parte lenta, así que la velocidad cae en picado en cuanto una porción significativa se queda fuera. Si ves que el reparto deja más de un tercio del modelo en CPU, mejor baja de tamaño de modelo.

Con generación de imagen y vídeo el fallo es más brusco. Muchas herramientas simplemente lanzan un error de memoria insuficiente y se paran. Hay opciones de descarga a RAM, pero multiplican los tiempos por varias veces.

Tus dos palancas antes de gastar dinero son estas:

  1. Bajar la cuantización. Pasar de 8 a 4 bits casi divide entre dos la memoria necesaria. Los formatos tipo Q4 son el equilibrio habitual entre tamaño y calidad. Por debajo de 3 bits la degradación empieza a notarse en tareas de razonamiento y de código.
  2. Recortar el contexto. Una ventana enorme se paga en VRAM aunque nunca la llenes, porque muchos programas la reservan por adelantado. Bajar de 32k a 8k libera gigas de golpe.

Si todavía no has probado nada de esto en tu máquina, el camino corto es instalar un gestor de modelos y medir con lo que ya tienes antes de comprar nada. Tienes los pasos en la guía para instalar una IA en local con Ollama.

Mide lo que tienes antes de comprar

Con el modelo cargado y trabajando, estos dos comandos te dan casi toda la información que necesitas:

nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv
ollama ps

El primero te dice qué tarjeta tienes, cuánta memoria total ofrece y cuánta hay ocupada en ese instante. El segundo, si usas Ollama, muestra el modelo cargado, lo que ocupa y qué porcentaje se está ejecutando en GPU frente a CPU. Ese porcentaje es el dato clave: si no marca GPU al cien por cien, estás pagando el peaje del reparto y notándolo en cada respuesta.

Para vigilarlo durante una tarea larga, deja esto corriendo en otra ventana:

nvidia-smi -l 2

Se refresca cada dos segundos y te enseña la memoria ocupada, el uso del núcleo y la temperatura. Si la memoria vive pegada al techo, el problema es de capacidad y solo se arregla con otra tarjeta o con un modelo más pequeño. Si sobra memoria pero la temperatura sube y el rendimiento baja según avanza la sesión, el problema es de refrigeración y sale mucho más barato de resolver.

Lo que la VRAM no arregla

La memoria decide qué puedes cargar. Estas cuatro cosas deciden si la experiencia es agradable:

Dos gráficas: cuándo suma y cuándo no

La idea de juntar dos tarjetas para sumar memoria es tentadora y funciona a medias.

Funciona con modelos de lenguaje. Los motores de inferencia reparten capas entre tarjetas, así que dos de 16 GB te dejan cargar un modelo que necesita 28 GB. Pagas latencia en la comunicación entre ambas, pero es una opción real.

No funciona igual en generación de imagen y vídeo. La mayoría de esas herramientas ejecutan el modelo en una sola tarjeta. Con dos gráficas puedes lanzar dos trabajos a la vez, que no es lo mismo que hacer uno grande. Y ojo con el detalle de conectividad: NVLink desapareció de las gamas de consumo después de la serie 30, así que en RTX 40 y 50 toda la comunicación entre tarjetas pasa por PCIe.

Súmale la fuente más grande, el calor y los conflictos de espacio en la caja. Para la mayoría de la gente, una tarjeta con más memoria es mejor compra que dos pequeñas.

Portátil o sobremesa

Aquí hay una trampa de nombres que conviene conocer. Una GPU de portátil con el mismo nombre comercial que una de sobremesa no es la misma pieza: suele llevar menos VRAM y trabaja con un límite de consumo mucho más bajo, que además cada fabricante configura a su gusto. Dos portátiles con la misma gráfica sobre el papel pueden rendir muy distinto según cuánta energía y refrigeración les dé el chasis.

Hay un segundo detalle que se nota en IA más que jugando. Una partida dura un rato y tiene pausas; una tanda de generación de imágenes o una transcripción larga mantienen la tarjeta al máximo sin descanso. En un chasis fino, eso acaba en bajada de frecuencias y en tiempos que se alargan según avanza la sesión. Si vas a trabajar así, mira el sistema de refrigeración con tanto interés como la ficha de la gráfica.

Eso no descarta el portátil. Si necesitas moverte, es la única opción. Solo tienes que mirar la cifra de VRAM del modelo concreto y no fiarte del nombre. Los criterios de compra los desgloso en la guía de portátiles con GPU para IA y edición.

Qué comprar según lo que vayas a hacer

Solo quiero un asistente de texto en local, privado y decente. Con 12 GB vas sobrado para modelos de 7 a 14B cuantizados, que hoy son sorprendentemente competentes para redactar, resumir y programar cosas pequeñas.

Genero imágenes y quiero probar los modelos nuevos. Apunta a 16 GB. Los modelos de imagen recientes son grandes y los flujos con varios pasos encadenados consumen más de lo que parece.

Transcribo, subtitulo y traduzco material. Es el caso más barato de todos. Con 8 a 12 GB ejecutas modelos de transcripción grandes sin despeinarte. Si tu flujo empieza bajando el vídeo o el audio con Daun y sigue con una transcripción en local, no necesitas gama alta para nada.

Quiero ajustar modelos o tocar generación de vídeo. Aquí sí manda la memoria por encima de todo. 24 GB es el suelo cómodo y 32 GB te quita bloqueos. Es el único perfil en el que la gama alta se justifica sola.

Voy justo de presupuesto. Busca la mayor cantidad de VRAM de la generación anterior antes que la tarjeta nueva de gama media. En IA local envejece mucho mejor.

Preguntas frecuentes

¿Sirve una gráfica AMD o un Mac con chip de Apple?

Sirven, con matices. Los Mac con memoria unificada pueden dedicar mucha memoria al modelo, y eso los hace muy capaces con modelos grandes, aunque más lentos generando imagen. Las AMD funcionan con ROCm y han mejorado, pero te vas a encontrar más fricción: proyectos que asumen CUDA, dependencias que no compilan y guías que no aplican. Si valoras tu tiempo por encima del ahorro, NVIDIA sigue siendo el camino sin sorpresas.

¿Cuánta RAM del sistema necesito acompañando a la gráfica?

Como mínimo, tanta como VRAM tengas, y a ser posible el doble. 32 GB es una cifra cómoda para la mayoría de escenarios domésticos. Se nota sobre todo al cargar modelos y al trabajar con varias aplicaciones abiertas, no tanto durante la inferencia.

¿Es mejor una RTX antigua de gama alta o una nueva de gama media?

Si la antigua tiene más VRAM, casi siempre la antigua. Perderás eficiencia energética y funciones nuevas, pero ganarás la capacidad de ejecutar modelos que la otra ni carga. Revisa el consumo y el estado de la tarjeta si la compras usada, y asegúrate de que tu fuente aguanta.

¿Puedo usar la GPU para IA mientras edito vídeo?

Puedes, pero compiten por la misma memoria. Un modelo cargado ocupa su espacio aunque esté en reposo, y el editor lo va a echar de menos al previsualizar o exportar. Si haces las dos cosas a diario, es otro argumento para subir de gigas en lugar de subir de potencia.