Cómo generar miniaturas para YouTube con ChatGPT
Cómo usar ChatGPT para diseñar miniaturas que se entiendan en miniatura: prompts que funcionan, composición, texto legible y qué corregir después a mano.
Tu miniatura no se ve en un monitor de 27 pulgadas. Se ve en un móvil, del tamaño de un sello, con el pulgar ya en marcha. Generar miniaturas de YouTube con ChatGPT resuelve muy bien la parte cara del trabajo (el fondo, la luz, el objeto que no tienes a mano) y falla justo en lo que más se nota: el texto, las caras y los logos. Aquí tienes prompts que puedes copiar tal cual, el flujo completo hasta el archivo subido y la lista honesta de lo que vas a tener que arreglar tú.
Lo que hace bien y lo que hace mal
Antes de escribir nada conviene saber dónde está el límite. Esta es la conclusión de trabajar a diario con el generador de imágenes de ChatGPT para portadas:
| Tarea | Cómo responde | Qué hacer |
|---|---|---|
| Fondos, escenarios y ambientes | Muy bien | Déjale inventarlos enteros |
| Objetos genéricos (portátil, taza, cámara) | Bien | Descríbelos por función, no por marca |
| Luz dramática y color saturado | Muy bien | Pídelo explícito, no lo hace solo |
| Caras anónimas con gesto exagerado | Bien | Nombra la emoción exacta que quieres |
| Dejar un hueco libre para el texto | Regular, obedece si insistes | Repite la instrucción y recorta después |
| Coherencia de estilo entre varias portadas | Regular, se desvía a la tercera | Repite paleta, luz y encuadre en cada prompt |
| Texto grande de dos o tres palabras | Irregular, se come tildes y eñes | Ponlo tú en un editor |
| Texto pequeño, párrafos, cifras | Mal | Ni lo intentes |
| Tu cara reconocible | Mal | Recorta una foto real tuya |
| Manos, dedos, cables, teclados | Irregular | Evita primeros planos de manos |
| Logos de marcas | Mal, y además te mete en un lío | Usa formas genéricas |
| Capturas de programas reales | Se las inventa enteras | Usa tu propia captura |
La regla que resume la tabla: pídele la escena, no el cartel. La escena la clava. El cartel lo montas tú en dos minutos y queda mucho mejor.
La miniatura se decide antes de abrir ChatGPT
El error más común no es un prompt malo, es no tener una idea. Antes de generar, contesta a esto en una frase: ¿qué ve alguien que pasa scrolleando en medio segundo?
Tres reglas que funcionan casi siempre:
- Un solo punto de atención. Un sujeto, un objeto o una cara. Si hay tres cosas importantes, no hay ninguna.
- Contraste bruto. Sujeto claro sobre fondo oscuro, o al revés. Dos colores dominantes y ya está. Las miniaturas grises desaparecen en el feed.
- Máximo cuatro palabras de texto, y que no repitan el título. El título ya está justo al lado. La miniatura tiene que añadir algo, no repetir.
Si el gancho de tu vídeo es una frase concreta que dices en cámara, sácala de la transcripción en vez de inventártela: transcribir el vídeo con Whisper en tu propio equipo te da el texto exacto y con marcas de tiempo, y de paso te dice en qué segundo está el fotograma bueno.
Requisitos técnicos que no puedes saltarte
| Parámetro | Valor |
|---|---|
| Resolución recomendada | 1280 x 720 px |
| Proporción | 16:9 |
| Ancho mínimo | 640 px |
| Peso máximo del archivo | 2 MB |
| Formatos aceptados | JPG, PNG, GIF, BMP |
| Zona que conviene dejar limpia | Esquina inferior derecha |
Esa esquina inferior derecha importa: ahí se superpone el rótulo con la duración del vídeo. Si pones tu cara o una palabra clave justo ahí, se come un trozo.
Ten en cuenta también dónde se va a ver. La misma imagen sale diminuta en el feed del móvil, mediana en los resultados de búsqueda y en la columna de sugeridos, y grande en un televisor. No hay una versión para cada sitio: el archivo es uno solo. Por eso la prueba que manda es siempre la pequeña. Si aguanta a tamaño de sello, aguanta en todas partes. Al revés no pasa.
El detalle que descoloca a todo el mundo: el tamaño apaisado que devuelve ChatGPT no siempre es 16:9. La salida horizontal habitual es de 1536 x 1024 px, que es 3:2. Según la versión del modelo que tengas puedes pedir directamente proporciones más anchas, pero no lo des por hecho. Trabaja siempre con margen: compón la escena sabiendo que vas a recortar arriba y abajo, y no metas nada crítico cerca del borde superior o inferior.
Prompts para generar miniaturas de YouTube con ChatGPT
Un prompt de miniatura que funciona tiene siempre las mismas piezas: sujeto, acción, fondo, luz, paleta, composición (dónde queda el hueco) y la prohibición explícita de escribir texto. Si te saltas la última, el modelo te llenará la imagen de letras deformes.
La plantilla base
Crea una imagen apaisada para una miniatura de YouTube.
Sujeto: [qué se ve, en una frase]
Acción o gesto: [qué está haciendo]
Fondo: [lugar o textura], desenfocado, sin detalles que distraigan
Luz: fuerte y lateral, con un contraluz de color [color] que separe
al sujeto del fondo
Paleta: dos colores dominantes, [color A] y [color B], muy saturados
Composición: el sujeto ocupa el tercio derecho y mira hacia la izquierda.
Deja el tercio izquierdo casi vacío y oscuro, voy a poner texto encima.
Estilo: fotografía real, nitidez alta.
No escribas ninguna letra, número ni símbolo en la imagen.
Cambia los corchetes y tienes casi todo el trabajo hecho. Guárdala en un archivo de texto: la vas a reutilizar en cada vídeo.
Variante para tutorial técnico
Imagen apaisada para miniatura de YouTube sobre un tutorial de edición de vídeo.
En el centro derecha, un portátil abierto visto en tres cuartos sobre una mesa
de madera oscura. La pantalla emite luz azul intensa pero no muestra ninguna
interfaz concreta, solo un resplandor abstracto.
Alrededor, dos o tres objetos de escritorio fuera de foco (taza, cuaderno,
un cable enrollado).
Luz nocturna, contraste alto, azules y naranjas.
La mitad izquierda queda en penumbra y vacía para colocar texto encima.
Sin letras, sin logotipos, sin marcas visibles en ningún objeto.
Fíjate en "no muestra ninguna interfaz concreta". Es a propósito. Si le pides una pantalla con un programa reconocible, te devuelve una parodia de ese programa con menús imposibles y palabras inventadas, y cualquiera que conozca la herramienta lo detecta al instante.
Variante para comparativa
Imagen apaisada para miniatura de YouTube, composición de comparación.
Divide la escena en dos mitades con una diagonal marcada en el centro.
Izquierda: [objeto A] sobre fondo azul frío, luz limpia y suave.
Derecha: [objeto B] sobre fondo naranja cálido, luz dura y contrastada.
Los dos objetos del mismo tamaño, centrados en su mitad y ligeramente
girados hacia la cámara. Fondo liso, sin textura.
Deja una franja estrecha en el centro para añadir un símbolo después.
No dibujes texto ni símbolos.
Variante con tu propia foto
Aquí conviene bajar las expectativas. Si le pides que te integre en la escena, lo normal es que regenere tu cara y salgas pareciéndote a ti solo de lejos. El flujo fiable es otro: que genere únicamente el fondo, y tú pegas encima tu foto recortada.
Te adjunto una foto mía recortada sobre fondo transparente.
No modifiques la foto ni generes personas.
Genera solo un fondo apaisado: [escena], con la luz principal viniendo
desde la derecha para que encaje con la de mi foto, y una zona oscura
y despejada a la izquierda.
Sin texto.
Cuando el modelo se niega
Hay peticiones que no te va a atender, y conviene saberlo antes de perder media hora. Las caras de personas reales identificables, sobre todo si son conocidas, se rechazan o vuelven con un parecido deliberadamente vago. Los personajes con derechos y los logotipos registrados van por el mismo camino. Y si describes una escena violenta o sexualizada para llamar la atención, aparte de que probablemente no te la genere, es justo el tipo de portada que te puede costar la monetización del vídeo.
Ante un rechazo, no insistas con el mismo prompt: reformula en términos genéricos. En lugar del nombre de una persona, describe el arquetipo (una mujer de unos cuarenta, pelo corto, gesto de sorpresa). En lugar del logo, pide una forma abstracta con los colores de esa marca. Casi siempre el resultado es mejor para una miniatura, porque un rostro anónimo con una expresión clara se lee mucho mejor en pequeño que un parecido a medias.
Cómo iterar sin volverte loco
La primera imagen casi nunca vale. A la tercera o la cuarta suele salir algo aprovechable. El truco es cambiar una sola cosa por iteración: si pides tres cambios a la vez, el modelo reescribe la escena entera y pierdes lo que ya funcionaba.
Frases de corrección que dan resultado tal cual:
Misma imagen, pero con el sujeto más pequeño y desplazado a la derecha.
Sube el contraste del fondo y oscurece la mitad izquierda.
Quita todas las letras y símbolos que has añadido.
Cambia el color del contraluz a magenta y no toques nada más.
Mantén exactamente la composición y cambia solo la expresión de la cara.
Cuando una imagen se acerque, pídele tres variaciones de esa misma escena y quédate con la mejor. Es más rápido que empezar de cero.
Para la parte de escribir (título, texto de la miniatura, ganchos alternativos) no hace falta subir nada a la nube: un modelo pequeño te vale de sobra y va rápido en tu equipo. Si nunca has montado uno, instalar una IA en local con Ollama es cuestión de un rato y te deja un generador de titulares siempre disponible, sin cuotas de uso.
El texto ponlo tú, no el modelo
Es la parte donde más gente se rinde y sube una miniatura con "TUTORIAI COMPLETO" en letras torcidas. Los generadores de imagen han mejorado mucho con el texto en inglés, pero en español siguen tropezando con tildes, eñes y signos de apertura, y el tamaño de letra que eligen suele ser demasiado pequeño para el feed.
El flujo correcto:
- Genera la imagen sin nada de texto, con una zona despejada.
- Ábrela en un editor. Canva, Figma, Photopea, GIMP o Inkscape: cualquiera sirve, y todos permiten trabajar directamente sobre un lienzo de 1280 x 720.
- Escribe el texto con una tipografía de palo seco muy gruesa, en mayúsculas o casi.
- Sepáralo del fondo con contorno grueso, sombra dura o una caja de color plano.
- Exporta y mira el resultado al 20 % de tamaño.
Reglas de texto que aguantan bien la prueba del móvil:
- Entre dos y cuatro palabras. Cinco ya es un párrafo.
- La palabra más importante, en otro color.
- Nada de texto sobre zonas con detalle. Fondo plano debajo, siempre.
- Nunca en la esquina inferior derecha.
Caras, logos y capturas: los tres fallos que se notan
Las caras. Si es tu cara, olvídate de generarla. El parecido es aproximado y el público de tu canal te reconoce. Fotografíate con el móvil contra una pared lisa, recorta y compón encima del fondo generado. Si es una cara anónima, sí puede generarse sin problema, pero revisa dientes, orejas y manos, que es donde se rompe.
Los logos. Pedir el logotipo de una empresa conocida tiene dos problemas. Uno técnico: sale deformado, con letras a medio inventar. Otro más serio: usar marcas ajenas en tus portadas puede darte disgustos, sobre todo si la miniatura sugiere que hablas en nombre de esa empresa. Usa siluetas genéricas o el icono oficial descargado por tu cuenta cuando su licencia lo permita.
Las capturas de programas. Todo lo que ChatGPT dibuja de una interfaz es ficción. Si tu vídeo va de una herramienta concreta, haz la captura real y móntala sobre el fondo generado. Y si el fotograma que necesitas está en un vídeo que ya publicaste, puedes bajarte el archivo con Daun y sacar la imagen exacta con ffmpeg:
ffmpeg -ss 00:01:23 -i video.mp4 -frames:v 1 -q:v 2 fotograma.jpg
Del render al archivo subido
Ya tienes la imagen y el texto. Falta dejarla en el formato correcto y comprobar que se entiende pequeña.
Recorte a 16:9 y escalado a 1280 x 720, partiendo de una salida apaisada de 1536 x 1024:
ffmpeg -i miniatura.png -vf "crop=1536:864,scale=1280:720" -q:v 3 miniatura.jpg
El recorte se centra por defecto, así que se pierde una franja arriba y otra abajo. Por eso compones con margen. Si necesitas mover el encuadre, añade el desplazamiento vertical a la instrucción de recorte.
La prueba definitiva, y la que casi nadie hace, es mirarla al tamaño real de un feed:
ffmpeg -i miniatura.jpg -vf scale=320:-1 prueba.png
Abre prueba.png, aléjate un metro de la pantalla y responde: ¿se lee el texto?, ¿se distingue el sujeto?, ¿se entiende de qué va el vídeo? Si fallas una, vuelve al editor. Y si el JPG se pasa de 2 MB (raro a esta resolución, pero pasa con PNG), baja la calidad un punto y listo.
Cuándo ChatGPT no es la herramienta
Ser honesto también es saber cuándo cerrar la pestaña:
- Necesitas volumen y coherencia de estilo. Veinte miniaturas al mes con la misma estética se hacen mejor con un modelo que puedas fijar con una semilla y un flujo repetible. Ahí es donde compensa generar imágenes en tu propio PC con Stable Diffusion y ComfyUI: control total, sin coste por imagen y resultados reproducibles.
- Trabajas en vertical. Las portadas de Shorts, Reels y TikTok tienen otra lógica, con más zona segura perdida por la interfaz. Ese caso encaja mejor con las herramientas de IA para producir vídeo corto.
- La foto real gana. Un producto físico, un montaje que has hecho de verdad, tu cara con una expresión concreta. Un generador nunca va a competir con la credibilidad de algo que existe.
- El canal vive de la precisión técnica. Si tu audiencia son desarrolladores o editores, una interfaz inventada te resta autoridad antes de que hayan pulsado play.
Lo razonable es mezclar: fondo generado, sujeto real, texto tuyo. Es rápido, sale barato y no parece hecho con plantilla.
Preguntas frecuentes
¿Puedo pedirle una miniatura ya en 1280 x 720?
Puedes pedirlo, y a veces te devuelve algo cercano. Pero en la mayoría de versiones el tamaño lo elige el modelo entre sus formatos disponibles, no el prompt, así que no te fíes. Genera en apaisado, comprueba las dimensiones reales del archivo y recorta al final. Es un paso de treinta segundos que te evita subir una imagen deformada.
¿Se nota que una miniatura está hecha con IA?
En el fondo, casi nunca. En las caras, las manos y el texto, casi siempre. Por eso el reparto que funciona es fondo generado más elementos reales. La gente no penaliza la IA en sí, penaliza los seis dedos y las letras torcidas.
¿Cuántas variantes merece la pena generar?
Tres o cuatro de la idea buena, no quince de ideas distintas. Si a la cuarta iteración la imagen no funciona, el problema suele ser el concepto, no el prompt. Vuelve a la frase de partida y replantéala.
¿Puedo poner mi cara en una miniatura generada?
Tu propia cara, sí, y lo mejor es pegar una foto real en vez de generarla. Lo que no deberías hacer es generar la cara de otra persona con aspecto realista para insinuar que aparece en tu vídeo. Es un problema legal y, sobre todo, es la clase de portada que quema la confianza de tu audiencia en una sola visita.