Cómo instalar una IA en local con Ollama, paso a paso
Guía completa para tener un modelo de lenguaje corriendo en tu propio ordenador con Ollama: instalación, primeros modelos, memoria necesaria y errores habituales.
Instalar una IA en local con Ollama suena a proyecto de fin de semana y se resuelve en veinte minutos. Al terminar tendrás un modelo de lenguaje respondiendo dentro de tu ordenador, sin cuenta, sin cuota mensual y sin que lo que escribes salga de tu disco. Esta guía va del instalador al primer error típico, explicando en cada paso qué está pasando por debajo.
Qué es Ollama y qué hace de verdad
Ollama no es una IA. Es el programa que ejecuta la IA. Hace tres cosas: descarga los pesos de un modelo desde un catálogo, los carga en la memoria de tu equipo y te deja hablar con él, desde la terminal o a través de un pequeño servidor local.
Esa distinción importa más de lo que parece. El "cerebro" es el modelo (familias como Llama, Qwen, Gemma, Mistral o Phi), que en la práctica es un archivo enorme lleno de números. Ollama es el motor que lo pone en marcha y le da una puerta de entrada. Cambiar de modelo es cambiar de archivo, no reinstalar nada.
También conviene saber lo que no hace. No busca en internet. No lee tus carpetas salvo que tú le pegues el texto. No entrena nada ni "aprende" de tus conversaciones: cada chat empieza en blanco. Y su interfaz es deliberadamente sobria, pensada para la terminal y para que otras aplicaciones se conecten por detrás. Si lo que buscas es una ventana con historial y buscador de modelos, tiene más sentido empezar por LM Studio y su enfoque de aplicación de escritorio.
Requisitos reales antes de instalar una IA en local con Ollama
Aquí es donde la mayoría de guías mienten por omisión. Ollama arranca en casi cualquier equipo moderno, pero la experiencia cambia radicalmente según la memoria que tengas y dónde esté esa memoria.
La regla básica: el modelo entero tiene que caber en la VRAM de tu tarjeta gráfica para que vaya rápido. Si no cabe, Ollama reparte lo que puede entre GPU y RAM del sistema, y la velocidad se desploma. Si no hay GPU compatible, tira solo de CPU y sigue funcionando, pero a otro ritmo.
Estas cifras son aproximadas y se refieren a modelos cuantizados a 4 bits, que es lo que descargas por defecto:
| Tamaño del modelo | Descarga aproximada | Memoria recomendada | Qué esperar |
|---|---|---|---|
| 1B a 3B | 1 a 2,5 GB | 8 GB de RAM | Muy rápido, útil para resumir, reescribir y clasificar |
| 7B a 9B | 4 a 6 GB | 8 GB de VRAM o 16 GB de RAM | El punto dulce para uso general en equipos normales |
| 12B a 14B | 7 a 10 GB | 12 GB de VRAM | Mejor redacción y razonamiento, ya pide gráfica dedicada |
| 27B a 32B | 16 a 20 GB | 24 GB de VRAM | Calidad alta, solo con gráficas de gama alta |
| 70B | Unos 40 GB | 48 GB de VRAM o mucha paciencia | Territorio de varias GPU o de servidores |
En Windows y Linux la memoria que manda es la VRAM de la gráfica. En los Mac con Apple Silicon la memoria es unificada, así que el límite práctico es la RAM total del equipo menos lo que use el sistema. Si quieres afinar el cálculo antes de descargar nada, tenemos el detalle en la tabla de VRAM por modelo.
Además necesitas espacio en disco, y más del que crees: los modelos se acumulan rápido y es fácil acabar con decenas de gigas ocupados sin darte cuenta. Un SSD ayuda con los tiempos de carga.
Instalación paso a paso en Windows, macOS y Linux
El instalador pesa poco, pero deja un servicio en segundo plano que arranca con el sistema. Es normal: ese servicio es el que atiende las peticiones.
Windows
- Descarga el instalador desde la web oficial de Ollama y ejecútalo. No pide permisos de administrador ni instala dependencias raras.
- Si prefieres la terminal, con el gestor de paquetes de Windows basta una línea:
bash
winget install Ollama.Ollama
- Necesitas Windows 10 en una versión actualizada (22H2 o superior) o Windows 11. Con gráfica NVIDIA, ten los drivers al día antes de empezar.
- Al terminar verás un icono en la bandeja del sistema. Eso significa que el servidor local ya está escuchando.
macOS
Descarga la aplicación, arrástrala a la carpeta de aplicaciones y ábrela una vez para que registre el comando en la terminal. Con chip Apple Silicon el modelo aprovecha la memoria unificada directamente, sin copiar los pesos a una VRAM aparte, y por eso rinde bien incluso en portátiles. En Macs con procesador Intel el trabajo recae prácticamente en la CPU, así que cuenta con modelos pequeños y con esperas bastante más largas.
Linux
La forma recomendada es el script de instalación oficial que aparece en la página de descargas: una sola línea con curl que detecta tu distribución, instala los binarios y crea un servicio de systemd. Después, comprueba que el servicio está vivo:
systemctl status ollama
Comprueba que ha funcionado
En cualquiera de los tres sistemas, abre una terminal y escribe:
ollama --version
Si te devuelve un número de versión, ya lo tienes. Si dice que el comando no existe, cierra y vuelve a abrir la terminal: el instalador añade Ollama al PATH y las ventanas ya abiertas no se enteran.
Tu primer modelo, con un solo comando
Ahora viene la parte satisfactoria. Un solo comando descarga el modelo, lo carga y abre el chat:
ollama run llama3.2
La primera vez tardará: está bajando varios gigas. Las siguientes veces arranca en segundos porque el modelo ya vive en tu disco. Cuando termine verás un prompt >>> esperando. Escribe cualquier cosa y tendrás la respuesta generándose palabra a palabra delante de ti, sin pasar por ningún servidor ajeno.
Para salir, escribe /bye. Los nombres y las etiquetas de los modelos cambian con el tiempo, así que si un comando concreto falla, consulta el catálogo dentro de la propia aplicación y sustituye el nombre.
Lo que acaba de pasar, resumido: Ollama ha pedido al catálogo el manifiesto del modelo, ha descargado sus capas, las ha guardado en una carpeta local, ha cargado los pesos en la memoria de tu GPU (o en la RAM), ha convertido tu frase en tokens y ha ido prediciendo el siguiente token una y otra vez. Nada de eso ha salido de tu ordenador.
Los comandos que vas a usar cada día
| Comando | Para qué sirve |
|---|---|
ollama run modelo |
Descarga si hace falta, carga y abre el chat |
ollama pull modelo |
Solo descarga, útil para dejarlo preparado |
ollama list |
Modelos que tienes en disco y cuánto ocupan |
ollama ps |
Modelos cargados ahora mismo y si están en GPU o en CPU |
ollama stop modelo |
Lo saca de la memoria sin borrarlo del disco |
ollama rm modelo |
Lo borra del disco y recupera el espacio |
ollama show modelo |
Ficha técnica: parámetros, cuantización, contexto |
ollama serve |
Arranca el servidor a mano si no lo lleva un servicio |
Dentro del chat también tienes atajos. /clear borra la conversación actual sin cerrar el modelo, /set parameter num_ctx 8192 amplía la memoria de la conversación, /show info enseña la ficha del modelo cargado y /? lista el resto. Para escribir varias líneas, envuelve el texto entre """.
De todos ellos, el que más te va a salvar es ollama ps. Te dice en una línea si el modelo está corriendo entero en la gráfica o si se ha desbordado a la CPU, que es la causa número uno de "esto va lentísimo".
Cómo elegir modelo y cuantización sin perder la tarde
Dos números definen un modelo: sus parámetros (3B, 8B, 14B, 70B) y su cuantización, que es cuánta precisión se ha recortado para que ocupe menos.
Los parámetros marcan el techo de calidad. La cuantización marca cuánto de ese techo puedes permitirte. Las etiquetas por defecto de Ollama usan una cuantización de 4 bits, un equilibrio que la comunidad lleva años usando porque la pérdida de calidad es pequeña y el ahorro de memoria es enorme.
La regla práctica, cuando dudes: es mejor un modelo grande a 4 bits que uno pequeño a 8 bits, siempre que quepa en tu memoria. Bajar de 4 bits, en cambio, suele empeorar las respuestas de forma bastante evidente.
Y ahora la parte honesta. Un modelo de 3B en tu portátil no razona como los grandes servicios de pago, y quien te diga lo contrario te está vendiendo algo. Para resumir, reescribir, traducir, extraer datos de un texto o clasificar, cumple de sobra. Para razonamiento largo, matemáticas o código complejo, notarás la diferencia. Si sabes eso desde el principio, la IA en local te parecerá una herramienta excelente en lugar de una decepción.
El servidor local: donde Ollama deja de ser un juguete
Mientras Ollama está en marcha, escucha en localhost:11434. Ahí es donde está el valor real, porque cualquier aplicación de tu equipo puede hablar con el modelo. Puedes comprobarlo desde la terminal:
curl http://localhost:11434/api/tags
Eso devuelve la lista de modelos instalados en JSON. Ollama también expone una ruta compatible con el formato de la API de OpenAI, así que muchas herramientas que esperan ese formato funcionan cambiando la dirección y poniendo cualquier cosa como clave. Editores de código, gestores de notas, clientes de chat y scripts propios se conectan así.
Ahí es donde encajan los flujos de trabajo de verdad. Por ejemplo: descargas el audio de una charla larga con Daun, lo pasas por la herramienta de transcripción que uses y le entregas el texto resultante al modelo local para que te saque el resumen y los puntos clave, todo sin subir el contenido a ningún sitio.
Un aviso de seguridad: por defecto el servidor solo acepta conexiones de tu propio equipo y no tiene contraseña. Si cambias esa configuración para abrirlo a la red local, cualquiera que llegue a ese puerto podrá usar tus modelos. Hazlo solo en redes de confianza.
Ajustes que cambian la experiencia
Cuatro cosas que merecen la pena en cuanto lleves unos días usándolo:
- Mover la carpeta de modelos. Por defecto se guardan en tu carpeta de usuario. Si tienes el sistema en un SSD pequeño, la variable de entorno
OLLAMA_MODELSapunta a otro disco y te ahorra el susto. - Controlar cuánto se queda en memoria. Tras unos minutos sin uso, Ollama descarga el modelo de la memoria. Con
OLLAMA_KEEP_ALIVEalargas o acortas ese margen. Si vas a hacer muchas preguntas seguidas, ponerlo alto evita esperar la recarga cada vez. - Ampliar el contexto. Por defecto Ollama usa una ventana de contexto conservadora, de unos pocos miles de tokens, para que quepa en equipos normales. Si le pasas documentos largos y ves que "olvida" el principio, súbela con
num_ctxen la sesión o con la variableOLLAMA_CONTEXT_LENGTH. Ojo: más contexto es más memoria ocupada. - Crear tu propia variante. Un archivo de texto llamado
Modelfilecon una instrucciónSYSTEMfija la personalidad o el idioma del modelo, y conollama createlo registras como uno más. Es la forma limpia de tener un asistente que siempre responde como tú quieres.
Las variables de entorno se ponen en las variables del sistema en Windows, en el servicio de systemd en Linux y desde la propia aplicación en macOS. En los tres casos hay que reiniciar Ollama para que las lea.
Errores habituales y cómo salir de ellos
Va lentísimo. Lanza ollama ps y mira el reparto. Si aparece parte en CPU, el modelo no cabe entero en la gráfica: baja de tamaño o de cuantización. Si tu equipo no tiene GPU dedicada, la lentitud es esperable y hay margen de mejora eligiendo bien, como contamos en la guía para tirar de IA sin tarjeta gráfica.
Error de memoria al cargar. El mensaje suele decir que el modelo necesita más memoria de la disponible. No hay truco: modelo más pequeño, menos contexto, o cerrar el navegador con cuarenta pestañas abiertas, que también consume VRAM.
La gráfica no se usa. Casi siempre son los drivers. En portátiles con gráfica híbrida, comprueba que el sistema no esté forzando la integrada. En Linux, revisa que estén instalados los controladores propietarios y no los genéricos.
El puerto ya está ocupado. Significa que Ollama ya está corriendo, normalmente como servicio o desde el icono de la bandeja. No lances otra instancia: usa la que hay.
La descarga se corta. Vuelve a lanzar el mismo pull. Ollama reanuda desde donde iba, no empieza de cero.
Ocupa demasiado disco. ollama list te enseña el desglose y ollama rm limpia lo que ya no usas. Los modelos que probaste una tarde siguen ahí.
Si después de este recorrido tienes claro que prefieres una interfaz gráfica, o al revés, que quieres exprimir la terminal, hemos comparado ambos caminos caso por caso en Ollama frente a LM Studio.
Preguntas frecuentes
¿Necesito tarjeta gráfica para instalar una IA en local con Ollama?
No. Ollama funciona solo con CPU y RAM, y con modelos pequeños la velocidad es perfectamente usable para tareas cortas. Lo que cambia con una GPU es el ritmo: donde una gráfica dedicada escupe las palabras más rápido de lo que lees, una CPU puede tardar bastante en cada respuesta. Si vas a trabajar sin gráfica, quédate en el rango de 1B a 3B parámetros.
¿Ollama funciona sin internet?
Sí, una vez descargado el modelo. La conexión solo hace falta para bajar modelos nuevos y para comprobar actualizaciones. Puedes desconectar el wifi y seguir chateando: es justo la gracia de tener el modelo en tu disco.
¿Puedo usar varios modelos a la vez?
Puedes tenerlos todos instalados y alternar entre ellos con ollama run. Cargar dos a la vez en memoria es posible, pero solo si te sobra VRAM para ambos. Lo habitual es tener uno pequeño y rápido para el día a día y otro más grande para cuando la respuesta importa.
¿Cómo desinstalo todo si no me convence?
Desinstala la aplicación por la vía normal de tu sistema operativo y luego borra a mano la carpeta oculta .ollama de tu carpeta de usuario, que es donde viven los modelos. Si no la borras, seguirás con decenas de gigas ocupados sin razón.