daun.pw

LM Studio: usar modelos de IA en tu ordenador sin conexión

· 11 min de lectura · 2357 palabras

Guía de LM Studio de principio a fin: instalar, elegir modelo, ajustar el contexto, servirlo como API local y saber cuándo se te queda corto.

Quieres probar un modelo de lenguaje en tu propio ordenador, sin cuentas ni límites de mensajes y sin que tus textos salgan de casa, pero abrir una terminal te da pereza. Esta guía de LM Studio en español recorre el camino completo con interfaz gráfica: instalar, elegir un modelo que tu equipo aguante, tocar el contexto y la descarga a GPU, y servirlo como API local para tus propias herramientas. También te digo dónde se rompe y cuándo conviene cambiar de programa.

Qué es LM Studio y qué no hace

Los pasos para dejar LM Studio funcionando
Los pasos para dejar LM Studio funcionando

LM Studio es una aplicación de escritorio que hace tres cosas: busca y descarga modelos, los ejecuta en tu máquina y te da un chat para hablar con ellos. Por debajo usa llama.cpp para modelos en formato GGUF y, en Mac con chip de Apple, también MLX. Ninguno de esos motores lo instalas tú: vienen dentro y se actualizan desde la propia app.

Conviene tener claro lo que no es. No es un servicio en la nube, así que no hay cuenta ni créditos ni cola de espera. No entrena ni afina modelos. No transcribe audio ni genera imágenes. Es un ejecutor de modelos de texto (y de imágenes de entrada, si cargas un modelo con visión). La aplicación en sí no es de código abierto, aunque su CLI y sus SDK sí lo son, igual que los motores que usa por debajo. Si eso te chirría, tu camino es instalar una IA en local con Ollama y punto.

La ventaja frente a la terminal es que lo que en otras herramientas es una línea de un fichero de configuración, aquí es un desplegable con su etiqueta y un valor por defecto razonable.

Requisitos: qué equipo pide y qué vas a notar

El requisito que manda es la memoria. Un modelo ocupa espacio mientras responde, y ese espacio sale de la VRAM de tu gráfica o, si no cabe, de la RAM del sistema, que es bastante más lenta. En Windows y Linux necesitas además un procesador x86 moderno con instrucciones AVX2. En Mac, un chip de la serie Apple Silicon, donde la memoria es unificada y el reparto lo gestiona el sistema.

Equipo Qué mueve con soltura Qué vas a notar
Portátil sin gráfica dedicada, 16 GB de RAM Modelos de 3B a 8B muy cuantizados Funciona, pero lento y con el ventilador a tope
RTX de gama de entrada, 8 GB de VRAM 7B y 8B en Q4 con holgura Respuestas fluidas para chat y redacción
RTX con 12 GB de VRAM Hasta 14B en Q4, u 8B con mucho contexto El punto dulce para la mayoría
RTX con 16 GB de VRAM 14B cómodo, 24B ajustado Empiezas a notar modelos claramente mejores
RTX con 24 GB de VRAM (3090 o 4090) 32B en Q4, o modelos medianos con contexto amplio Poco te va a frenar en local
Mac con Apple Silicon y 32 GB o más Depende del reparto de memoria unificada Silencioso y eficiente, algo por detrás en picos

Son cifras orientativas para hacerte una idea antes de descargar nada. Si quieres el cálculo fino, con el peso del modelo, el del contexto y el margen que hay que dejar libre, lo tienes desglosado en la tabla de cuánta VRAM necesita cada modelo de IA. Reserva también espacio en disco: cada modelo son varios gigas y se acumulan a una velocidad que sorprende.

Instalar LM Studio paso a paso

La instalación no tiene truco y es igual de aburrida en los tres sistemas, que es exactamente lo que quieres.

  1. Descarga el instalador desde la web oficial del proyecto, eligiendo tu sistema operativo. Ojo con bajarlo de sitios raros: es un ejecutable con acceso a tu disco.
  2. En Windows, ejecuta el instalador y acepta la ruta por defecto. En macOS, arrastra la app a Aplicaciones. En Linux, dale permiso de ejecución al AppImage y ábrelo.
  3. Abre la aplicación. La primera pantalla te ofrece descargar un modelo pequeño de arranque. Puedes aceptarlo para comprobar que todo funciona o saltártelo.
  4. Entra en los ajustes y cambia la carpeta de modelos si tu disco principal va justo. Es más fácil hacerlo ahora que cuando tengas veinte gigas repartidos.
  5. Comprueba en la pestaña de runtimes que la app ha detectado tu gráfica. Si tienes una NVIDIA y ahí solo aparece CPU, actualiza el driver antes de seguir.

Ese último punto se lo salta mucha gente y luego se pregunta por qué su modelo de 8B contesta como si se lo estuviera pensando. El motor que se use (CUDA, Vulkan, ROCm o CPU) separa una respuesta que llega al momento de otra que te deja mirando el cursor.

Elegir el primer modelo sin perder la tarde

En la pestaña de búsqueda escribes el nombre de una familia de modelos y te salen decenas de variantes del mismo modelo. No son modelos distintos: es el mismo comprimido de formas distintas. Esa compresión se llama cuantización y es lo que decide si te cabe o no.

La regla práctica para empezar: elige la variante Q4_K_M del modelo más grande que te quepa. Es el equilibrio que usa casi todo el mundo a diario. Si te sobra memoria, sube a Q5 o Q6. Si no llegas por poco, baja a Q3 sabiendo que la calidad se resiente de verdad. Tienes el detalle de qué significa cada letra y cada número en la guía de cuantización de modelos GGUF.

LM Studio ayuda bastante aquí, porque etiqueta cada descarga según tu hardware y avisa de si el modelo entra entero en la gráfica o si es demasiado grande para tu máquina. Hazle caso a esa etiqueta: es la diferencia entre una herramienta usable y una demo lenta que abandonas en dos días.

Dos apuntes más. Si vas a trabajar en español, prefiere modelos con buen soporte multilingüe, porque muchos modelos pequeños entienden nuestro idioma pero escriben claramente mejor en inglés. Y para tareas de código busca variantes entrenadas para eso: un generalista de 7B decepciona escribiendo funciones.

Los ajustes que de verdad cambian el resultado

Aquí es donde la interfaz gráfica se gana el sueldo. Al cargar un modelo aparece un panel con parámetros que en otras herramientas están escondidos en ficheros de configuración.

Longitud de contexto

Es cuánto texto puede tener en la cabeza a la vez: tu conversación entera más lo que va respondiendo. Cuanto más contexto, más memoria consume, y no de forma simbólica: pasar de unos pocos miles de tokens a decenas de miles puede añadir gigas de consumo con el mismo modelo cargado, y cuántos depende de la arquitectura del modelo. Empieza modesto (4.000 u 8.000) y súbelo solo cuando necesites meter documentos largos. Si la conversación se vuelve lenta a mitad, el culpable suele ser el contexto lleno, no el modelo.

Descarga a GPU

Es el número de capas del modelo que se mandan a la gráfica. Todo lo que no cabe se ejecuta en la CPU, y ahí está la mayor diferencia de velocidad que vas a ver en toda la aplicación. Sube el control al máximo y, si la carga falla o el sistema se ahoga, baja unas cuantas capas. Un modelo entero en la gráfica y ese mismo modelo repartido con la CPU no juegan en la misma liga, y lo notas desde la primera respuesta.

Runtime, caché y muestreo

En la pestaña de runtimes eliges el motor y lo actualizas por separado de la aplicación, algo que agradecerás cuando salga un modelo nuevo que tu versión todavía no entiende. Ahí aparecen opciones como Flash Attention o la cuantización de la caché de contexto, que recortan el consumo del contexto largo a cambio de un pelín de calidad. En los ajustes de inferencia tienes la temperatura (baja para respuestas precisas, alta para escritura creativa) y el system prompt, donde le dices que responda siempre en español de España y con el tono que quieras. Guarda esa combinación como preset y la recuperas con un clic.

Servir el modelo como API local en tu ordenador

Esta es la función que convierte LM Studio en algo más que un chat bonito. En la pestaña de desarrollador activas el servidor local y la app expone una API compatible con el formato de OpenAI, por defecto en el puerto 1234, que puedes cambiar si lo tienes ocupado. Cualquier programa que sepa hablar con esa API puede apuntar a tu ordenador en vez de a internet.

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nombre-del-modelo-cargado",
    "messages": [
      {"role": "user", "content": "Resume este texto en dos frases."}
    ],
    "temperature": 0.7
  }'

En la configuración de cualquier cliente compatible, pon http://localhost:1234/v1 como URL base y una clave de API cualquiera, porque no se valida. Si activas la opción de servir en la red local, otros equipos de tu casa pueden usar el mismo modelo, con el cuidado evidente de no exponer ese puerto a internet.

Y sí, hay terminal si la quieres. LM Studio trae una CLI llamada lms que automatiza lo mismo que haces con el ratón.

lms server start
lms server status
lms ls
lms ps
lms load nombre-del-modelo
lms unload --all
lms log stream

El último comando es el más útil cuando algo falla: te muestra en directo lo que recibe el servidor, incluido el prompt completo que le manda el programa que estás conectando. Ahí se descubre la mitad de los problemas de plantilla y de formato.

Un apunte para creadores. Si tu material de partida son vídeos, con Daun puedes bajar el vídeo o solo el audio y trabajar después con ese archivo. LM Studio no transcribe, así que la transcripción tendrás que conseguirla por otra vía y luego pegársela al modelo para que resuma, saque titulares o escriba la descripción.

Problemas típicos y cómo salir de ellos

Casi todo lo que sale mal el primer día está en esta tabla.

Síntoma Causa probable Qué hacer
El modelo no carga o la app se cierra No cabe en memoria con ese contexto Baja la longitud de contexto o usa una cuantización menor
Responde a un ritmo desesperante Está corriendo en CPU Sube la descarga a GPU y revisa el runtime detectado
Empieza rápido y se va frenando El contexto se está llenando Abre un chat nuevo o reduce el contexto máximo
Contesta en inglés aunque escribas en español Modelo flojo en multilingüe o sin instrucciones Fija el idioma en el system prompt o cambia de modelo
Se inventa datos de un PDF adjunto El documento no cabe entero y se lee a trozos Haz preguntas concretas y trocea el documento tú
Otro programa no conecta con el servidor Servidor apagado o URL mal puesta Comprueba el estado del servidor y que la URL acaba en /v1
Se repite en bucle o corta a media frase Muestreo mal ajustado o plantilla del modelo Toca la penalización por repetición y revisa el preset
La descarga del modelo se corta a medias Conexión inestable o disco lleno Reanuda la descarga y comprueba el espacio libre de la carpeta de modelos

Una advertencia honesta sobre los documentos adjuntos: cuando le pasas un PDF largo, el sistema no se lo lee entero, selecciona los fragmentos que le parecen relevantes. Para buscar un dato concreto funciona bien. Para un "resume este informe de ochenta páginas" te va a dar algo plausible y parcial, y no siempre te avisa de lo que se ha dejado fuera.

Qué llevarte de esta guía de LM Studio en español

Si tuvieras que quedarte con cinco decisiones, son estas: instala y comprueba que detecta la gráfica, descarga un modelo en Q4 del tamaño que te quepa, ajusta contexto y descarga a GPU antes de juzgar la velocidad, guarda un preset con tu system prompt en español, y activa el servidor local solo cuando vayas a conectar otra herramienta.

También conviene saber cuándo esta no es tu herramienta. LM Studio vive en el escritorio: quiere una pantalla y una sesión gráfica abierta. Para un servidor sin monitor, un contenedor, un script que arranque solo o una máquina compartida por varias personas, el enfoque de línea de comandos encaja mejor y consume menos. Tampoco es la opción si necesitas afinar modelos, generar imágenes o montar una canalización compleja. La comparación de casos, con las ventajas de cada uno y sin postureo, la tienes en Ollama o LM Studio: cuál te conviene según tu caso. Y no son incompatibles: mucha gente prueba modelos en la interfaz gráfica y luego se los lleva a la terminal para el trabajo de verdad.

Preguntas frecuentes

¿LM Studio funciona sin conexión a internet?

Sí, una vez descargado el modelo. Necesitas conexión para bajar la aplicación, los modelos y las actualizaciones de los motores. A partir de ahí puedes desconectar el cable y seguir trabajando: la inferencia ocurre entera en tu ordenador y tus conversaciones no salen de él. Ese es el motivo principal por el que mucha gente monta esto en local.

¿Puedo usar los modelos que ya tengo descargados con Ollama?

No de forma directa, porque cada herramienta organiza su almacén a su manera. LM Studio trabaja con ficheros GGUF en carpetas, así que un GGUF suelto lo puedes colocar en su carpeta de modelos y lo detectará al reiniciar. Lo que Ollama guarda en su formato interno no lo reaprovechas sin exportarlo antes, y para un modelo de cuatro o cinco gigas sale más a cuenta descargarlo otra vez que pelearse con las rutas.

¿Cuánto tarda en responder un modelo en local?

Depende tanto del equipo que cualquier cifra concreta te engañaría. La referencia útil es cualitativa: con el modelo entero en la VRAM de una gráfica dedicada, el texto suele aparecer más rápido de lo que lo lees. Con el modelo repartido entre gráfica y CPU se vuelve incómodo, aunque usable. Y con todo en CPU sirve para tareas por lotes donde puedas esperar, no para conversar.

¿Es seguro dejar el servidor local activado?

Mientras escuche solo en localhost, únicamente tu ordenador puede hablar con él. El riesgo aparece cuando activas el acceso desde la red local: en una red doméstica de confianza es cómodo, pero no abras ese puerto en el router ni lo enciendas en una wifi pública. La API no pide una clave real, así que cualquiera que llegue al puerto puede usar tu modelo.