Qué GPU NVIDIA RTX necesitas para IA en local
Qué mirar de verdad en una gráfica para ejecutar modelos de IA en casa: VRAM antes que potencia, diferencias entre generaciones y qué caso de uso pide cada una.
Elegir una GPU NVIDIA RTX para IA local se reduce, casi siempre, a una sola cifra: los gigas de VRAM. Los núcleos CUDA, la generación y la frecuencia influyen en lo rápido que va, pero la VRAM decide algo más básico, que es si el modelo arranca o no. En esta guía tienes cómo traducir lo que quieres hacer en gigas concretos, qué cambia entre generaciones y en qué momento gastar más deja de compensar.
La VRAM manda sobre todo lo demás
Un modelo de IA se ejecuta cargando sus pesos en la memoria de la gráfica. Si los pesos caben, la tarjeta trabaja a su ritmo. Si no caben, pasa una de dos cosas: el programa se cae con un error de memoria, o reparte parte del modelo en la RAM del sistema y lo mueve por el bus PCIe cada vez que lo necesita. Esa segunda opción funciona, pero el rendimiento se hunde. No es un poco más lento: es la diferencia entre leer la respuesta según se escribe y esperar mirando el techo.
De ahí sale la regla que ordena toda la compra: una tarjeta más lenta con más VRAM le gana casi siempre a una tarjeta más rápida que no puede cargar el modelo. La potencia bruta mejora los segundos por imagen o los tokens por segundo. La VRAM decide qué modelos existen para ti y cuáles no.
Hay una segunda razón, menos evidente. En generación de texto, la velocidad depende sobre todo del ancho de banda de la memoria, no de la capacidad de cálculo. La tarjeta pasa el rato leyendo pesos de la VRAM una y otra vez. Por eso dos tarjetas con la misma memoria pero distinto bus se comportan diferente, y por eso las cifras de teraflops de las fichas técnicas explican menos de lo que parece.
Cuánta VRAM pide cada tarea
La cuenta rápida para un modelo de lenguaje es esta: multiplica los miles de millones de parámetros por los bytes que ocupa cada uno según la precisión.
- Precisión FP16 o BF16: 2 GB por cada mil millones de parámetros.
- Cuantización de 8 bits: 1 GB por cada mil millones.
- Cuantización de 4 bits (los populares Q4 de GGUF): en torno a 0,5 GB por cada mil millones.
A ese número súmale margen. El contexto (la ventana de conversación) se guarda en la caché KV y crece con la longitud, así que un contexto largo puede añadir varios gigas por su cuenta. Cuenta un 20 o 25 por ciento extra sobre el tamaño del modelo y no te llevarás sustos.
| Lo que quieres hacer | VRAM cómoda |
|---|---|
| Modelo de lenguaje de 7-8B en 4 bits | 8 GB |
| Modelo de 13-14B en 4 bits | 12 GB |
| Modelo de 30-32B en 4 bits | 24 GB |
| Modelo de 70B en 4 bits | 48 GB o reparto entre tarjetas |
| Generación de imagen con SDXL | 8-12 GB |
| Modelos de imagen modernos tipo Flux, cuantizados | 12-16 GB |
| Transcripción con Whisper en su versión grande | 8-10 GB |
| Ajuste fino ligero (LoRA) de un modelo de 7B | 16-24 GB |
| Generación de vídeo | 24 GB y subiendo |
Si quieres el desglose por familias de modelos y no por tareas, lo tienes en la tabla práctica de VRAM por modelo, que va modelo a modelo.
Qué cambia entre RTX 30, RTX 40 y RTX 50
Las tres generaciones de consumo que te vas a encontrar hoy sirven para IA local. La diferencia está en eficiencia, formatos numéricos soportados y, otra vez, memoria.
| Generación | Arquitectura | Lo relevante para IA |
|---|---|---|
| RTX 30 | Ampere | Tensor cores con FP16 y BF16. Sin FP8. Consumo alto para lo que rinde. La RTX 3090 con 24 GB es la vía más asequible a mucha VRAM si la buscas de segunda mano |
| RTX 40 | Ada Lovelace | Añade FP8 en los tensor cores y mejora bastante el rendimiento por vatio. La 4090 mantiene 24 GB |
| RTX 50 | Blackwell | Añade soporte nativo de FP4 y memoria GDDR7, más rápida. La 5090 sube a 32 GB, el primer salto real de capacidad en varias generaciones |
Un matiz honesto sobre los formatos nuevos: que la tarjeta soporte FP4 o FP8 no significa que tu software lo aproveche. La mayoría de la gente ejecuta modelos cuantizados con llama.cpp o herramientas construidas encima, y esas rutas usan sus propios formatos enteros que funcionan igual en las tres generaciones. El beneficio de FP4 llega cuando el motor de inferencia lo implementa. Compra pensando en gigas, no en siglas de la nota de prensa.
Tarjeta por tarjeta, ordenadas por memoria
| Tarjeta | VRAM | Para qué llega |
|---|---|---|
| RTX 3060 12 GB | 12 GB | La entrada más sensata de segunda mano. Modelos de 7-8B cómodos, SDXL justo pero viable |
| RTX 4060 Ti 16 GB | 16 GB | Mucha memoria para su gama, pero con un bus estrecho que la deja lenta en cargas grandes |
| RTX 4070 | 12 GB | Equilibrada. Se queda corta si te da por los modelos de 30B |
| RTX 5070 | 12 GB | Misma lógica que la anterior, con arquitectura más nueva |
| RTX 4070 Ti Super / 5070 Ti | 16 GB | El punto dulce actual para la mayoría de la gente |
| RTX 4080 / 5080 | 16 GB | Rápidas, pero pagas potencia que la VRAM no te deja explotar del todo |
| RTX 3090 | 24 GB | La rareza útil: vieja, tragona, y aun así te abre modelos que una 5080 no puede cargar |
| RTX 4090 | 24 GB | Techo cómodo. Rápida y con memoria de sobra para casi todo lo doméstico |
| RTX 5090 | 32 GB | La única de consumo que entra en modelos de 30B con contexto largo sin apretar |
Fíjate en el patrón. La 3090 y la 5080 están separadas por dos generaciones y la vieja gana en lo único que bloquea de verdad. Si el resto de la máquina te lo permite, ese es el criterio. Cómo montar ese resto (fuente, caja, ventilación, CPU) lo cuento en la guía de qué priorizar al montar un PC para IA en local.
Qué pasa de verdad cuando no cabe
Merece la pena entender el fallo antes de comprar, porque marca dónde está tu límite real.
Con modelos de lenguaje, herramientas como Ollama o llama.cpp reparten capas: las que caben van a la GPU y el resto se queda en la CPU. El modelo funciona, responde y no se cae. Pero cada token tiene que pasar por la parte lenta, así que la velocidad cae en picado en cuanto una porción significativa se queda fuera. Si ves que el reparto deja más de un tercio del modelo en CPU, mejor baja de tamaño de modelo.
Con generación de imagen y vídeo el fallo es más brusco. Muchas herramientas simplemente lanzan un error de memoria insuficiente y se paran. Hay opciones de descarga a RAM, pero multiplican los tiempos por varias veces.
Tus dos palancas antes de gastar dinero son estas:
- Bajar la cuantización. Pasar de 8 a 4 bits casi divide entre dos la memoria necesaria. Los formatos tipo Q4 son el equilibrio habitual entre tamaño y calidad. Por debajo de 3 bits la degradación empieza a notarse en tareas de razonamiento y de código.
- Recortar el contexto. Una ventana enorme se paga en VRAM aunque nunca la llenes, porque muchos programas la reservan por adelantado. Bajar de 32k a 8k libera gigas de golpe.
Si todavía no has probado nada de esto en tu máquina, el camino corto es instalar un gestor de modelos y medir con lo que ya tienes antes de comprar nada. Tienes los pasos en la guía para instalar una IA en local con Ollama.
Mide lo que tienes antes de comprar
Con el modelo cargado y trabajando, estos dos comandos te dan casi toda la información que necesitas:
nvidia-smi --query-gpu=name,memory.total,memory.used --format=csv
ollama ps
El primero te dice qué tarjeta tienes, cuánta memoria total ofrece y cuánta hay ocupada en ese instante. El segundo, si usas Ollama, muestra el modelo cargado, lo que ocupa y qué porcentaje se está ejecutando en GPU frente a CPU. Ese porcentaje es el dato clave: si no marca GPU al cien por cien, estás pagando el peaje del reparto y notándolo en cada respuesta.
Para vigilarlo durante una tarea larga, deja esto corriendo en otra ventana:
nvidia-smi -l 2
Se refresca cada dos segundos y te enseña la memoria ocupada, el uso del núcleo y la temperatura. Si la memoria vive pegada al techo, el problema es de capacidad y solo se arregla con otra tarjeta o con un modelo más pequeño. Si sobra memoria pero la temperatura sube y el rendimiento baja según avanza la sesión, el problema es de refrigeración y sale mucho más barato de resolver.
Lo que la VRAM no arregla
La memoria decide qué puedes cargar. Estas cuatro cosas deciden si la experiencia es agradable:
- Ancho de banda. Dos tarjetas con 16 GB pueden ir muy distinto generando texto. Mira el bus de memoria, no solo la capacidad.
- Fuente de alimentación. Las gamas altas tienen picos de consumo cortos y agresivos. Una fuente ajustada al milímetro provoca reinicios que parecen fallos de software y no lo son.
- Ventilación. Una sesión de inferencia larga no es como jugar una partida: la tarjeta se mantiene al máximo durante horas. Si la caja no evacúa aire, baja frecuencias y pierdes rendimiento de forma constante.
- RAM del sistema. Los modelos se cargan desde disco a RAM antes de subir a la GPU. Con poca RAM el arranque de cada modelo se vuelve un suplicio.
Dos gráficas: cuándo suma y cuándo no
La idea de juntar dos tarjetas para sumar memoria es tentadora y funciona a medias.
Funciona con modelos de lenguaje. Los motores de inferencia reparten capas entre tarjetas, así que dos de 16 GB te dejan cargar un modelo que necesita 28 GB. Pagas latencia en la comunicación entre ambas, pero es una opción real.
No funciona igual en generación de imagen y vídeo. La mayoría de esas herramientas ejecutan el modelo en una sola tarjeta. Con dos gráficas puedes lanzar dos trabajos a la vez, que no es lo mismo que hacer uno grande. Y ojo con el detalle de conectividad: NVLink desapareció de las gamas de consumo después de la serie 30, así que en RTX 40 y 50 toda la comunicación entre tarjetas pasa por PCIe.
Súmale la fuente más grande, el calor y los conflictos de espacio en la caja. Para la mayoría de la gente, una tarjeta con más memoria es mejor compra que dos pequeñas.
Portátil o sobremesa
Aquí hay una trampa de nombres que conviene conocer. Una GPU de portátil con el mismo nombre comercial que una de sobremesa no es la misma pieza: suele llevar menos VRAM y trabaja con un límite de consumo mucho más bajo, que además cada fabricante configura a su gusto. Dos portátiles con la misma gráfica sobre el papel pueden rendir muy distinto según cuánta energía y refrigeración les dé el chasis.
Hay un segundo detalle que se nota en IA más que jugando. Una partida dura un rato y tiene pausas; una tanda de generación de imágenes o una transcripción larga mantienen la tarjeta al máximo sin descanso. En un chasis fino, eso acaba en bajada de frecuencias y en tiempos que se alargan según avanza la sesión. Si vas a trabajar así, mira el sistema de refrigeración con tanto interés como la ficha de la gráfica.
Eso no descarta el portátil. Si necesitas moverte, es la única opción. Solo tienes que mirar la cifra de VRAM del modelo concreto y no fiarte del nombre. Los criterios de compra los desgloso en la guía de portátiles con GPU para IA y edición.
Qué comprar según lo que vayas a hacer
Solo quiero un asistente de texto en local, privado y decente. Con 12 GB vas sobrado para modelos de 7 a 14B cuantizados, que hoy son sorprendentemente competentes para redactar, resumir y programar cosas pequeñas.
Genero imágenes y quiero probar los modelos nuevos. Apunta a 16 GB. Los modelos de imagen recientes son grandes y los flujos con varios pasos encadenados consumen más de lo que parece.
Transcribo, subtitulo y traduzco material. Es el caso más barato de todos. Con 8 a 12 GB ejecutas modelos de transcripción grandes sin despeinarte. Si tu flujo empieza bajando el vídeo o el audio con Daun y sigue con una transcripción en local, no necesitas gama alta para nada.
Quiero ajustar modelos o tocar generación de vídeo. Aquí sí manda la memoria por encima de todo. 24 GB es el suelo cómodo y 32 GB te quita bloqueos. Es el único perfil en el que la gama alta se justifica sola.
Voy justo de presupuesto. Busca la mayor cantidad de VRAM de la generación anterior antes que la tarjeta nueva de gama media. En IA local envejece mucho mejor.
Preguntas frecuentes
¿Sirve una gráfica AMD o un Mac con chip de Apple?
Sirven, con matices. Los Mac con memoria unificada pueden dedicar mucha memoria al modelo, y eso los hace muy capaces con modelos grandes, aunque más lentos generando imagen. Las AMD funcionan con ROCm y han mejorado, pero te vas a encontrar más fricción: proyectos que asumen CUDA, dependencias que no compilan y guías que no aplican. Si valoras tu tiempo por encima del ahorro, NVIDIA sigue siendo el camino sin sorpresas.
¿Cuánta RAM del sistema necesito acompañando a la gráfica?
Como mínimo, tanta como VRAM tengas, y a ser posible el doble. 32 GB es una cifra cómoda para la mayoría de escenarios domésticos. Se nota sobre todo al cargar modelos y al trabajar con varias aplicaciones abiertas, no tanto durante la inferencia.
¿Es mejor una RTX antigua de gama alta o una nueva de gama media?
Si la antigua tiene más VRAM, casi siempre la antigua. Perderás eficiencia energética y funciones nuevas, pero ganarás la capacidad de ejecutar modelos que la otra ni carga. Revisa el consumo y el estado de la tarjeta si la compras usada, y asegúrate de que tu fuente aguanta.
¿Puedo usar la GPU para IA mientras edito vídeo?
Puedes, pero compiten por la misma memoria. Un modelo cargado ocupa su espacio aunque esté en reposo, y el editor lo va a echar de menos al previsualizar o exportar. Si haces las dos cosas a diario, es otro argumento para subir de gigas en lugar de subir de potencia.