🧰 UtlKit

Cómo Escribir Prompts de Imagen IA: Estructura T2I, Vocabulario Visual y Ejemplos

Cómo escribir prompts para modelos de texto a imagen: la estructura de ocho partes, el vocabulario visual al que responden los modelos, ejemplos resueltos y errores a evitar.

Por qué el prompt lo es todo en la imagen IA

Los modelos de texto a imagen (T2I) no "entienden" tu idea: comparan tus palabras con los patrones de los miles de millones de imágenes con las que se entrenaron. El prompt es la única instrucción que reciben, y pequeños matices de redacción cambian lo que pintan. "Un perro en un parque" y "un terrier alborotado en pleno salto tras una pelota de tenis, luz moteada entre los árboles, lente de 85 mm, profundidad de campo corta" producen dos imágenes completamente distintas del mismo modelo.

Esta guía cubre la estructura que funciona: la fórmula de ocho partes del prompt T2I, el vocabulario visual al que responden los modelos, cómo adaptar un mismo prompt al modelo que uses, y los errores que aplanan el resultado.

La fórmula del prompt T2I en ocho partes

Cada prompt T2I sólido responde, más o menos en este orden, a ocho preguntas:

  1. Sujeto — quién o qué hay en el cuadro, con detalles concretos (no "una persona", sino "un pescador curtido con chaqueta de lona").
  2. Detalles — los materiales y texturas que lo concretan: tejido, pelaje, piel, pátina del metal.
  3. Escena y momento — dónde ocurre y el ambiente: un callejón, un estudio, una costa. El momento del día y el tiempo marcan la paleta más que cualquier palabra de estilo.
  4. Composición — cómo se organiza el cuadro: regla de tercios, centrado, líneas de guía, espacio negativo, marco dentro del marco.
  5. Luz — el carácter de la luz: hora dorada, luz de borde, rayos volumétricos, neones, velas, luz suave de estudio, claroscuro.
  6. Color — la dirección de la paleta: teal y naranja, tonos tierra apagados, pastel, monocromo, tonos joya.
  7. Estilo, medio y ánimo — el lenguaje visual (fotorrealista, cinematográfico, anime, óleo, pixel art) y el tono emocional (dramático, sereno, melancólico).
  8. Cámara y formato — tamaño del plano (primer plano, cuerpo entero, gran angular), distancia focal (35 mm, 85 mm), ángulo y la relación de aspecto que de verdad necesitas.

Ejemplo resuelto

Ensamblado con las ocho partes anteriores, un retrato fotorrealista:

"un pescador mayor con la cara curtida por el sol, chaqueta de lona con restos de sal, de pie al final de un pequeño muelle al amanecer, niebla levantándose del agua, composición centrada con espacio negativo arriba, luz suave de la hora dorada desde la izquierda, tonos tierra apagados, fotografía fotorrealista, ánimo melancólico, lente de retrato de 85 mm, medio primer plano, 4:5"

Cuéntalo: sujeto, textura, lugar, hora, niebla, composición, luz, color, estilo, medio, ánimo, distancia focal, plano y formato — catorce elementos, cada cláusula hace un trabajo, nada de decoración. Una frase corta de calidad al final — "ultra detallado, iluminación natural" — el modelo la lee como objetivo de calidad.

Vocabulario visual que los modelos de imagen entienden

Los modelos de imagen se entrenan con fotos y obras de arte anotadas con terminología técnica, por eso los términos estándar funcionan. Los que más usarás:

  • Tamaño del plano — gran primer plano, primer plano, plano medio, plano entero, plano general, gran plano general, vista cenital, sobre el hombro, plano a dos personajes.
  • Ángulo — a la altura de los ojos, contrapicado, picado, plano aéreo, desde el suelo, neerlandés, POV.
  • Focal y profundidad — 24 mm gran angular, 35 mm de calle, 50 mm, 85 mm de retrato, 135 mm tele, macro 1:1; profundidad de campo corta con bokeh cremoso a f/1.4, o f/16 con todo nítido.
  • Luz — hora dorada, hora azul, contraluz, luz de borde, luz volumétrica, rayos de luz, neones, velas, luz de luna, high-key, low-key, luz Rembrandt, claroscuro, sombra dramática.
  • Película y textura — fotografía en película 35 mm, Kodak Portra 400, grano de película, fuga de luz, flash directo de compacta, fotograma VHS.
  • Medios artísticos — óleo al impasto, acuarela, lápiz de carbón, línea de tinta, lápices de colores, pixel art, arte isométrico, anime cel-shade, tramas de cómic, pop art, grabado ukiyo-e, glitch art.

No hace falta nombrarlos todos. Una o dos decisiones técnicas — "lente de retrato de 85 mm, profundidad de campo corta" u "óleo al impasto" — a menudo mueven más el resultado que tres adjetivos de estilo.

Adaptar el prompt al modelo

Los principales modelos de imagen salen de distintos laboratorios: Midjourney V7 (Midjourney), DALL·E 3 (OpenAI), Flux.1 (Black Forest Labs), Imagen 3 (Google) y Stable Diffusion 3.5 (Stability AI), más los modelos chinos Seedream (ByteDance), Kolors (Kuaishou), Wan y Z-Image Turbo (Alibaba), MiniMax Image y ERNIE ViLG (Baidu). Sus estrategias de prompting difieren en dos cosas prácticas:

  • Idioma. Los modelos chinos son nativos en chino — el prompt en chino les resulta más natural; el resto se entrenó sobre todo en inglés. Escribe en el idioma en que el modelo es más fuerte.
  • Frase de calidad. Cada modelo tiene su cierre preferido — Flux.1 "photorealistic, accurate detail", Midjourney V7 "cinematic, highly detailed, artistic composition". Añadir la adecuada hace que la misma selección se lea como prompt nativo en cada modelo.

El Generador de prompts de imagen IA gestiona ambas cosas: ajusta el idioma de salida al modelo (chino para los modelos chinos en la página en chino, inglés en todo lo demás) y añade el sufijo de calidad propio de cada modelo.

Siete errores que aplanan la imagen IA

  • Sujeto vago. "Alguien en algún sitio" deja que el modelo invente al protagonista; sé concreto sobre quién o qué hay en el cuadro.
  • Estilos en conflicto. "Óleo fotorrealista" se anula a sí mismo; elige un lenguaje visual y cúmplelo.
  • Sin intención de luz. Sin dirección de luz, el modelo por defecto da una luz plana, neutra y de catálogo; nombra tu luz.
  • Sopa de adjetivos. Veinte palabras de estilo diluyen cada instrucción; diez descriptores concretos suelen vencer a cincuenta adjetivos.
  • Idiomas mezclados. Mantén el prompt en un idioma; un prompt a medias traducido confunde al modelo.
  • Ignorar la relación de aspecto. El cuadrado por defecto no sirve para fondos de pantalla, banners o portadas — declara 16:9, 4:5 o 3:2 desde el principio.
  • Negaciones en vez de afirmaciones. "Sin desenfoque, sin dedos de más" funciona peor que describir lo que quieres: foco nítido, manos limpias, un solo sujeto.

Construye prompts con estructura

En lugar de texto libre, puedes elegir opciones de una rejilla estructurada. El Generador de prompts de imagen IA cubre 10 categorías — tipo de sujeto, escena, composición, luz, paleta de colores, estilo artístico, medio, ánimo, cámara y relación de aspecto — con una imagen de referencia para cada opción, y ensambla tu selección única por categoría en un prompt ajustado al modelo objetivo. Funciona enteramente en el navegador: nada de lo que escribes se sube.

Herramientas Relacionadas

Preguntas Frecuentes

¿Qué es un prompt de texto a imagen (T2I)?

El conjunto de palabras que entregas al modelo de imagen para describir lo que debe pintar: el sujeto más la dirección visual — escena, composición, luz, color, estilo, cámara, relación de aspecto. A diferencia de una consulta de búsqueda, el orden y la concreción importan: cuanto más concreto un detalle y cuanto antes aparece, más peso le da el modelo.

¿Qué debe incluir un prompt de imagen IA?

Ocho elementos: un sujeto concreto, detalles de textura y material, escena con momento del día, composición, luz, paleta de colores, estilo con medio y ánimo, y cámara con relación de aspecto. Mantén unos 30-80 descriptores concretos en un solo idioma y cierra con una frase corta de calidad.

¿De qué longitud debe ser un prompt de imagen IA?

Depende del modelo: Midjourney y DALL·E funcionan mejor con prompts concisos (unas 20-40 palabras), mientras que Flux y Stable Diffusion premian más detalle y aguantan 100+. Como regla, 30-80 palabras de descriptores concretos y sin ambigüedades es el punto dulce; un párrafo de 200 palabras suele funcionar peor.

¿Necesito un prompt distinto para cada modelo (Midjourney, DALL·E, Flux)?

La descripción central puede seguir siendo la misma, pero dos cosas deben adaptarse: el idioma (los modelos chinos como Seedream, Kolors, Wan, Z-Image Turbo, MiniMax Image y ERNIE ViLG se entrenan para responder a prompts en chino; el resto responde mejor en inglés) y la frase de calidad final, que varía por modelo. Un generador estructurado maneja ambas automáticamente.

¿Por qué mis imágenes IA se ven genéricas o lavadas?

Suele ser porque el prompt dejó las grandes decisiones al modelo. Nombra la luz (la luz plana y neutra es el default silencioso), elige un estilo y descarta adjetivos en conflicto, añade uno o dos detalles técnicos — lente, tamaño del plano, película — y declara la relación de aspecto. Diez descriptores concretos suelen vencer a una lista de adjetivos.

Artículos Relacionados