daun.pw

Cómo generar miniaturas para YouTube con ChatGPT

· 10 min de lectura · 2141 palabras

Cómo usar ChatGPT para diseñar miniaturas que se entiendan en miniatura: prompts que funcionan, composición, texto legible y qué corregir después a mano.

Tu miniatura no se ve en un monitor de 27 pulgadas. Se ve en un móvil, del tamaño de un sello, con el pulgar ya en marcha. Generar miniaturas de YouTube con ChatGPT resuelve muy bien la parte cara del trabajo (el fondo, la luz, el objeto que no tienes a mano) y falla justo en lo que más se nota: el texto, las caras y los logos. Aquí tienes prompts que puedes copiar tal cual, el flujo completo hasta el archivo subido y la lista honesta de lo que vas a tener que arreglar tú.

Lo que hace bien y lo que hace mal

Qué se lee en una miniatura al tamaño real en que se ve
Qué se lee en una miniatura al tamaño real en que se ve

Antes de escribir nada conviene saber dónde está el límite. Esta es la conclusión de trabajar a diario con el generador de imágenes de ChatGPT para portadas:

Tarea Cómo responde Qué hacer
Fondos, escenarios y ambientes Muy bien Déjale inventarlos enteros
Objetos genéricos (portátil, taza, cámara) Bien Descríbelos por función, no por marca
Luz dramática y color saturado Muy bien Pídelo explícito, no lo hace solo
Caras anónimas con gesto exagerado Bien Nombra la emoción exacta que quieres
Dejar un hueco libre para el texto Regular, obedece si insistes Repite la instrucción y recorta después
Coherencia de estilo entre varias portadas Regular, se desvía a la tercera Repite paleta, luz y encuadre en cada prompt
Texto grande de dos o tres palabras Irregular, se come tildes y eñes Ponlo tú en un editor
Texto pequeño, párrafos, cifras Mal Ni lo intentes
Tu cara reconocible Mal Recorta una foto real tuya
Manos, dedos, cables, teclados Irregular Evita primeros planos de manos
Logos de marcas Mal, y además te mete en un lío Usa formas genéricas
Capturas de programas reales Se las inventa enteras Usa tu propia captura

La regla que resume la tabla: pídele la escena, no el cartel. La escena la clava. El cartel lo montas tú en dos minutos y queda mucho mejor.

La miniatura se decide antes de abrir ChatGPT

Reparto realista entre lo que hace la IA y lo que haces tú
Reparto realista entre lo que hace la IA y lo que haces tú

El error más común no es un prompt malo, es no tener una idea. Antes de generar, contesta a esto en una frase: ¿qué ve alguien que pasa scrolleando en medio segundo?

Tres reglas que funcionan casi siempre:

Si el gancho de tu vídeo es una frase concreta que dices en cámara, sácala de la transcripción en vez de inventártela: transcribir el vídeo con Whisper en tu propio equipo te da el texto exacto y con marcas de tiempo, y de paso te dice en qué segundo está el fotograma bueno.

Requisitos técnicos que no puedes saltarte

Parámetro Valor
Resolución recomendada 1280 x 720 px
Proporción 16:9
Ancho mínimo 640 px
Peso máximo del archivo 2 MB
Formatos aceptados JPG, PNG, GIF, BMP
Zona que conviene dejar limpia Esquina inferior derecha

Esa esquina inferior derecha importa: ahí se superpone el rótulo con la duración del vídeo. Si pones tu cara o una palabra clave justo ahí, se come un trozo.

Ten en cuenta también dónde se va a ver. La misma imagen sale diminuta en el feed del móvil, mediana en los resultados de búsqueda y en la columna de sugeridos, y grande en un televisor. No hay una versión para cada sitio: el archivo es uno solo. Por eso la prueba que manda es siempre la pequeña. Si aguanta a tamaño de sello, aguanta en todas partes. Al revés no pasa.

El detalle que descoloca a todo el mundo: el tamaño apaisado que devuelve ChatGPT no siempre es 16:9. La salida horizontal habitual es de 1536 x 1024 px, que es 3:2. Según la versión del modelo que tengas puedes pedir directamente proporciones más anchas, pero no lo des por hecho. Trabaja siempre con margen: compón la escena sabiendo que vas a recortar arriba y abajo, y no metas nada crítico cerca del borde superior o inferior.

Prompts para generar miniaturas de YouTube con ChatGPT

Un prompt de miniatura que funciona tiene siempre las mismas piezas: sujeto, acción, fondo, luz, paleta, composición (dónde queda el hueco) y la prohibición explícita de escribir texto. Si te saltas la última, el modelo te llenará la imagen de letras deformes.

La plantilla base

Crea una imagen apaisada para una miniatura de YouTube.
Sujeto: [qué se ve, en una frase]
Acción o gesto: [qué está haciendo]
Fondo: [lugar o textura], desenfocado, sin detalles que distraigan
Luz: fuerte y lateral, con un contraluz de color [color] que separe
al sujeto del fondo
Paleta: dos colores dominantes, [color A] y [color B], muy saturados
Composición: el sujeto ocupa el tercio derecho y mira hacia la izquierda.
Deja el tercio izquierdo casi vacío y oscuro, voy a poner texto encima.
Estilo: fotografía real, nitidez alta.
No escribas ninguna letra, número ni símbolo en la imagen.

Cambia los corchetes y tienes casi todo el trabajo hecho. Guárdala en un archivo de texto: la vas a reutilizar en cada vídeo.

Variante para tutorial técnico

Imagen apaisada para miniatura de YouTube sobre un tutorial de edición de vídeo.
En el centro derecha, un portátil abierto visto en tres cuartos sobre una mesa
de madera oscura. La pantalla emite luz azul intensa pero no muestra ninguna
interfaz concreta, solo un resplandor abstracto.
Alrededor, dos o tres objetos de escritorio fuera de foco (taza, cuaderno,
un cable enrollado).
Luz nocturna, contraste alto, azules y naranjas.
La mitad izquierda queda en penumbra y vacía para colocar texto encima.
Sin letras, sin logotipos, sin marcas visibles en ningún objeto.

Fíjate en "no muestra ninguna interfaz concreta". Es a propósito. Si le pides una pantalla con un programa reconocible, te devuelve una parodia de ese programa con menús imposibles y palabras inventadas, y cualquiera que conozca la herramienta lo detecta al instante.

Variante para comparativa

Imagen apaisada para miniatura de YouTube, composición de comparación.
Divide la escena en dos mitades con una diagonal marcada en el centro.
Izquierda: [objeto A] sobre fondo azul frío, luz limpia y suave.
Derecha: [objeto B] sobre fondo naranja cálido, luz dura y contrastada.
Los dos objetos del mismo tamaño, centrados en su mitad y ligeramente
girados hacia la cámara. Fondo liso, sin textura.
Deja una franja estrecha en el centro para añadir un símbolo después.
No dibujes texto ni símbolos.

Variante con tu propia foto

Aquí conviene bajar las expectativas. Si le pides que te integre en la escena, lo normal es que regenere tu cara y salgas pareciéndote a ti solo de lejos. El flujo fiable es otro: que genere únicamente el fondo, y tú pegas encima tu foto recortada.

Te adjunto una foto mía recortada sobre fondo transparente.
No modifiques la foto ni generes personas.
Genera solo un fondo apaisado: [escena], con la luz principal viniendo
desde la derecha para que encaje con la de mi foto, y una zona oscura
y despejada a la izquierda.
Sin texto.

Cuando el modelo se niega

Hay peticiones que no te va a atender, y conviene saberlo antes de perder media hora. Las caras de personas reales identificables, sobre todo si son conocidas, se rechazan o vuelven con un parecido deliberadamente vago. Los personajes con derechos y los logotipos registrados van por el mismo camino. Y si describes una escena violenta o sexualizada para llamar la atención, aparte de que probablemente no te la genere, es justo el tipo de portada que te puede costar la monetización del vídeo.

Ante un rechazo, no insistas con el mismo prompt: reformula en términos genéricos. En lugar del nombre de una persona, describe el arquetipo (una mujer de unos cuarenta, pelo corto, gesto de sorpresa). En lugar del logo, pide una forma abstracta con los colores de esa marca. Casi siempre el resultado es mejor para una miniatura, porque un rostro anónimo con una expresión clara se lee mucho mejor en pequeño que un parecido a medias.

Cómo iterar sin volverte loco

La primera imagen casi nunca vale. A la tercera o la cuarta suele salir algo aprovechable. El truco es cambiar una sola cosa por iteración: si pides tres cambios a la vez, el modelo reescribe la escena entera y pierdes lo que ya funcionaba.

Frases de corrección que dan resultado tal cual:

Misma imagen, pero con el sujeto más pequeño y desplazado a la derecha.
Sube el contraste del fondo y oscurece la mitad izquierda.
Quita todas las letras y símbolos que has añadido.
Cambia el color del contraluz a magenta y no toques nada más.
Mantén exactamente la composición y cambia solo la expresión de la cara.

Cuando una imagen se acerque, pídele tres variaciones de esa misma escena y quédate con la mejor. Es más rápido que empezar de cero.

Para la parte de escribir (título, texto de la miniatura, ganchos alternativos) no hace falta subir nada a la nube: un modelo pequeño te vale de sobra y va rápido en tu equipo. Si nunca has montado uno, instalar una IA en local con Ollama es cuestión de un rato y te deja un generador de titulares siempre disponible, sin cuotas de uso.

El texto ponlo tú, no el modelo

Es la parte donde más gente se rinde y sube una miniatura con "TUTORIAI COMPLETO" en letras torcidas. Los generadores de imagen han mejorado mucho con el texto en inglés, pero en español siguen tropezando con tildes, eñes y signos de apertura, y el tamaño de letra que eligen suele ser demasiado pequeño para el feed.

El flujo correcto:

  1. Genera la imagen sin nada de texto, con una zona despejada.
  2. Ábrela en un editor. Canva, Figma, Photopea, GIMP o Inkscape: cualquiera sirve, y todos permiten trabajar directamente sobre un lienzo de 1280 x 720.
  3. Escribe el texto con una tipografía de palo seco muy gruesa, en mayúsculas o casi.
  4. Sepáralo del fondo con contorno grueso, sombra dura o una caja de color plano.
  5. Exporta y mira el resultado al 20 % de tamaño.

Reglas de texto que aguantan bien la prueba del móvil:

Caras, logos y capturas: los tres fallos que se notan

Las caras. Si es tu cara, olvídate de generarla. El parecido es aproximado y el público de tu canal te reconoce. Fotografíate con el móvil contra una pared lisa, recorta y compón encima del fondo generado. Si es una cara anónima, sí puede generarse sin problema, pero revisa dientes, orejas y manos, que es donde se rompe.

Los logos. Pedir el logotipo de una empresa conocida tiene dos problemas. Uno técnico: sale deformado, con letras a medio inventar. Otro más serio: usar marcas ajenas en tus portadas puede darte disgustos, sobre todo si la miniatura sugiere que hablas en nombre de esa empresa. Usa siluetas genéricas o el icono oficial descargado por tu cuenta cuando su licencia lo permita.

Las capturas de programas. Todo lo que ChatGPT dibuja de una interfaz es ficción. Si tu vídeo va de una herramienta concreta, haz la captura real y móntala sobre el fondo generado. Y si el fotograma que necesitas está en un vídeo que ya publicaste, puedes bajarte el archivo con Daun y sacar la imagen exacta con ffmpeg:

ffmpeg -ss 00:01:23 -i video.mp4 -frames:v 1 -q:v 2 fotograma.jpg

Del render al archivo subido

Ya tienes la imagen y el texto. Falta dejarla en el formato correcto y comprobar que se entiende pequeña.

Recorte a 16:9 y escalado a 1280 x 720, partiendo de una salida apaisada de 1536 x 1024:

ffmpeg -i miniatura.png -vf "crop=1536:864,scale=1280:720" -q:v 3 miniatura.jpg

El recorte se centra por defecto, así que se pierde una franja arriba y otra abajo. Por eso compones con margen. Si necesitas mover el encuadre, añade el desplazamiento vertical a la instrucción de recorte.

La prueba definitiva, y la que casi nadie hace, es mirarla al tamaño real de un feed:

ffmpeg -i miniatura.jpg -vf scale=320:-1 prueba.png

Abre prueba.png, aléjate un metro de la pantalla y responde: ¿se lee el texto?, ¿se distingue el sujeto?, ¿se entiende de qué va el vídeo? Si fallas una, vuelve al editor. Y si el JPG se pasa de 2 MB (raro a esta resolución, pero pasa con PNG), baja la calidad un punto y listo.

Cuándo ChatGPT no es la herramienta

Ser honesto también es saber cuándo cerrar la pestaña:

Lo razonable es mezclar: fondo generado, sujeto real, texto tuyo. Es rápido, sale barato y no parece hecho con plantilla.

Preguntas frecuentes

¿Puedo pedirle una miniatura ya en 1280 x 720?

Puedes pedirlo, y a veces te devuelve algo cercano. Pero en la mayoría de versiones el tamaño lo elige el modelo entre sus formatos disponibles, no el prompt, así que no te fíes. Genera en apaisado, comprueba las dimensiones reales del archivo y recorta al final. Es un paso de treinta segundos que te evita subir una imagen deformada.

¿Se nota que una miniatura está hecha con IA?

En el fondo, casi nunca. En las caras, las manos y el texto, casi siempre. Por eso el reparto que funciona es fondo generado más elementos reales. La gente no penaliza la IA en sí, penaliza los seis dedos y las letras torcidas.

¿Cuántas variantes merece la pena generar?

Tres o cuatro de la idea buena, no quince de ideas distintas. Si a la cuarta iteración la imagen no funciona, el problema suele ser el concepto, no el prompt. Vuelve a la frase de partida y replantéala.

¿Puedo poner mi cara en una miniatura generada?

Tu propia cara, sí, y lo mejor es pegar una foto real en vez de generarla. Lo que no deberías hacer es generar la cara de otra persona con aspecto realista para insinuar que aparece en tu vídeo. Es un problema legal y, sobre todo, es la clase de portada que quema la confianza de tu audiencia en una sola visita.