Ejecutar modelos de IA sin tarjeta gráfica: hasta dónde llegas
Qué se puede hacer con CPU y RAM, qué modelos son realistas sin GPU, cuánta velocidad pierdes y en qué momento compensa dar el salto.
Tienes un ordenador normal, sin gráfica dedicada, y quieres probar un modelo de lenguaje en tu propia máquina antes de gastarte nada. Buenas noticias: ejecutar IA en local sin GPU funciona de verdad, pero solo con ciertos modelos y a una velocidad que conviene aceptar antes de empezar. Aquí tienes hasta dónde llegas, qué se rompe, y en qué momento deja de tener sentido insistir.
Lo que frena a una CPU no es la potencia, es la memoria
La intuición normal dice que un procesador rápido genera texto rápido. No es así. Cuando un modelo escribe un token, tiene que leer sus pesos desde la memoria RAM. Todos. Cada token. Si el modelo ocupa 4 GB, tu equipo mueve 4 GB de memoria por cada token que aparece en pantalla, y un token suele ser un trozo de palabra, no una palabra entera.
Eso convierte la generación de texto en un problema de ancho de banda, no de cálculo. Un procesador moderno tiene potencia de sobra para las multiplicaciones; lo que no tiene es una tubería lo bastante gorda hacia la RAM. Y ahí es donde una gráfica saca ventaja: su memoria está pegada al chip y va varias veces más rápida.
| Tipo de memoria | Ancho de banda teórico aproximado |
|---|---|
| DDR4-3200, un solo módulo (canal simple) | unos 25 GB/s |
| DDR4-3200, dos módulos (doble canal) | unos 51 GB/s |
| DDR5-5600, dos módulos (doble canal) | unos 90 GB/s |
| Gráfica dedicada moderna con GDDR6 o GDDR6X | de 250 a más de 900 GB/s |
Y ojo: eso es el teórico. En la práctica se aprovecha bastante menos, y cuánto menos depende del equipo, del controlador de memoria y de lo que esté haciendo el resto del sistema. Quédate con la idea principal: entre la RAM de un PC normal y la memoria de una gráfica hay una diferencia de entre tres y diez veces según el modelo de gráfica, y esa diferencia se traduce casi directamente en la velocidad a la que el modelo escribe.
Cuántos tokens por segundo vas a ver realmente
Hay una cuenta de servilleta que sirve para estimar antes de descargar nada:
tokens por segundo ≈ ancho de banda útil (GB/s) / tamaño del modelo en disco (GB)
Con un equipo de doble canal DDR4 que aproveche unos 30 GB/s reales y un modelo de 7.000 millones de parámetros cuantizado a Q4 (unos 4 GB), salen alrededor de siete tokens por segundo. Eso es, más o menos, la velocidad a la que lees en voz alta. Se puede usar. No es cómodo, pero se puede usar.
Baja a un modelo de 3.000 millones (unos 2 GB) y la cuenta se duplica. Sube a uno de 14.000 millones (unos 8 GB) y se parte por la mitad: entrarás en territorio de esperar mirando la pantalla.
Hay un segundo tiempo que casi nadie menciona y que en CPU duele más: el procesado del prompt. Antes de escribir el primer token, el modelo tiene que leer todo lo que le has dado. Esa fase sí depende del cálculo puro y es donde una CPU se hunde. Preguntar "hola" es instantáneo. Pegar un documento de veinte páginas y pedir un resumen puede significar un buen rato de silencio antes de que salga la primera letra. Si tu plan era usar contextos enormes, ese es el muro real, no la generación.
Un apunte más: añadir hilos no arregla esto. Pasar de dos a seis núcleos se nota; pasar de ocho a dieciséis casi no, porque el cuello ya no está ahí. Configurar los hilos al número de núcleos físicos (no lógicos) suele dar el mejor resultado.
Qué modelos son realistas para ejecutar IA en local sin GPU
Esta es la tabla que te ahorra descargar quince gigas para nada. Los tamaños son con cuantización Q4_K_M, que es el punto de equilibrio habitual entre calidad y peso.
| Parámetros | Tamaño en disco (Q4) | RAM recomendada | Qué esperar en CPU |
|---|---|---|---|
| 0,5B a 1B | 0,4 a 0,9 GB | 8 GB | Muy rápido. Sirve para clasificar, extraer datos, etiquetar |
| 3B a 4B | 2 a 2,5 GB | 8 a 16 GB | Fluido. Resúmenes, reescrituras, preguntas cortas |
| 7B a 8B | 4 a 5 GB | 16 GB | El punto de equilibrio. Lento pero utilizable |
| 12B a 14B | 7 a 9 GB | 16 a 32 GB | Al límite. Vale para lotes, no para conversar |
| 30B o más (densos) | 18 GB en adelante | 32 a 64 GB | Descártalo salvo procesos en segundo plano |
| MoE con pocos expertos activos | Depende del total | Alta | Caso especial, ver más abajo |
Si te suenan a chino las siglas Q4_K_M, Q5 o Q8, en la guía sobre cuantización de modelos GGUF está explicado qué se pierde en cada escalón y por qué Q4 se ha convertido en el estándar de facto.
Una tentación clásica sin GPU es bajar mucho la cuantización para meter un modelo más grande. Suele ser mala idea. Un modelo de 7B en Q4 se comporta mejor que uno de 13B machacado a 2 bits, y encima va más rápido, porque ocupa menos y hay menos que leer en cada token. Cuando la cuantización baja de Q4 el modelo empieza a inventar, a repetirse y a perder el hilo de las instrucciones.
El caso especial: los modelos de mezcla de expertos
Los modelos MoE (mezcla de expertos) son la mejor noticia para quien no tiene gráfica. Guardan muchísimos parámetros pero solo activan una fracción en cada token. Un modelo con treinta mil millones de parámetros totales pero solo tres mil millones activos lee muchos menos datos por token, así que va a velocidad de modelo pequeño con calidad cercana a la de uno grande.
El precio: necesitas RAM para el modelo entero, aunque en cada token solo se use una parte. Si tienes 32 o 64 GB de RAM y ninguna gráfica, esta familia es la que más rendimiento te va a dar por euro no gastado.
Lo que sí funciona sorprendentemente bien sin gráfica
Fijarse solo en el chat es un error. Hay tareas de IA que en CPU van perfectamente porque los modelos son diminutos o porque el tiempo no importa.
- Transcripción de audio. Los modelos de reconocimiento de voz tipo Whisper en su versión optimizada para CPU van bien con los tamaños pequeños y medianos. Transcribir una entrevista mientras haces otra cosa es un caso de uso redondo sin gráfica. Si trabajas con vídeo, puedes bajar el audio de una entrevista o una charla con Daun y pasarle la transcripción local después.
- Embeddings y búsqueda semántica. Los modelos de embeddings tienen decenas o pocos cientos de millones de parámetros. Indexar tus notas y buscar por significado en local es trivial en CPU.
- Traducción y corrección con modelos pequeños. Un 3B bien elegido traduce y corrige a velocidad decente.
- Síntesis de voz ligera. Hay motores de texto a voz pensados para CPU que van a tiempo real o más rápido.
- Todo lo que sea por lotes. Si tienes que resumir cuatrocientos documentos, da igual que tarde toda la noche: lo lanzas antes de acostarte. La lentitud solo molesta cuando estás esperando delante.
- OCR y clasificación de imágenes. Los modelos de visión pequeños no son generativos y funcionan bien.
Lo que no vas a hacer sin GPU
Aquí va la parte honesta, la que casi ningún tutorial cuenta.
Generación de imágenes. Los modelos de difusión sí arrancan en CPU, pero cada imagen pasa de segundos a muchos minutos. Con los modelos de imagen más recientes y pesados, directamente no es viable. Si tu objetivo principal es generar imágenes, no pierdas el tiempo con la CPU.
Vídeo generativo. Ni lo intentes. Es varios órdenes de magnitud por encima de lo que una CPU doméstica puede sostener.
Entrenar o hacer fine-tuning. Ajustar un modelo, aunque sea con LoRA, requiere pasar los datos muchas veces por la red. Sin gráfica es inviable salvo con modelos de juguete.
Contextos largos. Aparte del tiempo de procesado del prompt, la caché de atención crece con el contexto y se come RAM. Un contexto de 32k tokens puede ocupar varios gigas adicionales sobre el modelo. En CPU, trabajar con 4k u 8k de contexto es lo razonable.
Agentes que encadenan llamadas. Si un flujo hace quince llamadas al modelo, multiplica la latencia por quince. Lo que en una gráfica es una espera corta, en CPU se convierte en minutos y en la sensación de que aquello no funciona.
Conversación por voz en tiempo real. Reconocimiento, modelo y síntesis en cadena no cuadran con siete tokens por segundo.
Si en algún momento te preguntas cuánta memoria de vídeo pediría cada uno de estos casos, la tabla práctica de VRAM por modelo te da la cifra antes de decidir nada.
Cómo montarlo en media hora
La ruta más corta es Ollama, que detecta solo que no hay gráfica y tira de CPU sin que tengas que configurar nada.
# descargar y hablar con un modelo pequeño
ollama run llama3.2:3b
# ver qué hay cargado, cuánto ocupa y si va por CPU o GPU
ollama ps
Cualquier otro modelo de 3B te vale igual; lo importante es empezar por ahí. La columna que interesa de ollama ps es la del procesador: si pone 100% CPU, ya sabes en qué escenario estás. Empieza siempre por un modelo pequeño aunque tengas RAM para más. Si te va fluido, subes. Al revés se sufre.
El paso a paso completo de instalación, con dónde se guardan los modelos y cómo borrarlos cuando te quedes sin disco, está en la guía de cómo instalar una IA en local con Ollama.
Si prefieres control fino, llama.cpp te deja tocar todo:
llama-server -m modelo-q4_k_m.gguf -c 4096 -t 6
Con -c fijas el contexto (mantenlo corto) y con -t los hilos (ponlo en tu número de núcleos físicos). Baja -c antes que la cuantización si te quedas sin RAM.
Ajustes que de verdad mueven la aguja
Por orden de impacto real, no de lo que se repite en foros:
- Pon la RAM en doble canal. Es el cambio con mejor relación entre lo que cuesta y lo que mejora. Muchos portátiles vienen con un solo módulo. Añadir un segundo módulo idéntico puede acercarse a duplicar el ancho de banda, y con él la velocidad de generación. Se nota más que cualquier ajuste de software.
- Ten RAM de sobra, no justa. Si el sistema empieza a tirar de disco porque el modelo no cabe, la velocidad se desploma a niveles absurdos. Deja siempre unos gigas libres para el sistema.
- Contexto corto. 4096 tokens en vez de 32768 ahorra RAM y acorta muchísimo la espera inicial.
- Q4_K_M como punto de partida. Sube a Q5 solo si te sobra memoria y notas fallos de calidad.
- Cierra el navegador con cuarenta pestañas. Compite por la misma memoria y el mismo ancho de banda.
- Prueba tu gráfica integrada. Las integradas recientes pueden echar una mano, sobre todo en el procesado del prompt. La mejora es modesta y a veces nula, pero es gratis probarlo.
- Si tienes un Mac con chip de Apple, juegas con otras cartas. La memoria unificada de los Mac modernos tiene más ancho de banda que la RAM de un PC típico, y bastante más en las variantes Pro y Max, así que un Mac "sin gráfica dedicada" rinde mejor de lo que sugiere esta guía. Es la excepción real a todo lo anterior.
En qué momento compensa dar el salto
No hay que comprar una gráfica por defecto. Hay que comprarla cuando se cumpla alguna de estas condiciones:
- Usas el modelo a diario y la espera te está costando más tiempo del que ahorras.
- Necesitas modelos de 14B o más para que la calidad sea suficiente en tu tarea.
- Quieres generar imágenes, y no de forma ocasional.
- Vas a montar agentes o flujos que encadenan varias llamadas.
- Necesitas contextos largos de verdad, con documentos completos dentro.
Si no se cumple ninguna, sigue en CPU tranquilo. Y antes de comprar, hay un paso intermedio muy sensato: alquilar una máquina con gráfica por horas para las tareas pesadas y dejar en local lo ligero. Así compruebas con datos si de verdad usarías la gráfica.
Cuando decidas dar el salto, lo que manda es la cantidad de memoria de vídeo, no el número del modelo. Con 8 GB de VRAM entras con soltura en modelos de 7B y 8B; con 12 GB te mueves cómodo hasta 14B; con 16 GB subes un escalón más y con 24 GB te caben los 30B cuantizados sin apreturas. Las gamas y los cortes concretos están desglosados en la guía sobre qué GPU NVIDIA RTX necesitas para IA en local.
Preguntas frecuentes
¿Cuánta RAM necesito como mínimo para empezar?
Con 8 GB puedes mover modelos de hasta 3B o 4B en Q4 sin dramas, siempre que no tengas medio sistema abierto. Con 16 GB entras en la franja de 7B y 8B, que es donde la calidad empieza a ser útil para trabajo real. Por debajo de 8 GB puedes probar modelos de 1B, pero la experiencia se queda en curiosidad.
¿Sirve de algo mi gráfica integrada?
A veces. Las integradas recientes de AMD e Intel pueden acelerar el procesado del prompt y, en algunos casos, la generación. El problema es que usan la misma RAM del sistema, así que el cuello de botella del ancho de banda sigue ahí. La ganancia suele ser moderada y depende mucho del controlador. Pruébalo, mide, y quédate con lo que vaya mejor.
¿Es mejor un modelo grande muy cuantizado o uno pequeño en Q4?
Casi siempre el pequeño en Q4. Un modelo de 8B en Q4 es más coherente y más rápido que uno de 14B aplastado a 2 bits. La cuantización agresiva no rebaja la calidad de forma suave: a partir de cierto punto el modelo empieza a fallar en el seguimiento de instrucciones, que es justo lo que necesitas.
¿Por qué la primera respuesta tarda tanto y luego va más suelto?
Por dos motivos que se suman. El primero es que el modelo tiene que cargarse desde el disco a la RAM, y eso son varios gigas. El segundo es el procesado del prompt, la fase previa a escribir el primer token. Una vez arrancado y con el modelo en memoria, las siguientes respuestas empiezan mucho antes, siempre que no cambies de modelo entre medias.