🧰 UtlKit

Cómo Escribir Prompts de Vídeo IA: Estructura T2V e I2V, Lenguaje de Cámara y Ejemplos

Por qué el prompt lo es todo en el vídeo IA

Los modelos de texto a vídeo (T2V) e imagen a vídeo (I2V) no "entienden" tu idea: cotejan tus palabras con los patrones del material fílmico con el que se entrenaron. El prompt es la única instrucción que reciben, y pequeñas decisiones de redacción cambian lo que generan. "Un coche en una carretera" y "un coche rojo de época conduciendo por una carretera costera al atardecer, plano de seguimiento" producen dos clips completamente distintos con el mismo modelo.

Esta guía cubre la estructura que funciona: el prompt T2V de seis partes, el vocabulario de cámara al que responden los modelos de vídeo, en qué difieren los prompts I2V y cómo adaptar un prompt al modelo que estés usando.

T2V e I2V: dos modos, dos prompts distintos

  • T2V (texto a vídeo) — escribes toda la toma en palabras: sujeto, acción, escenario, cámara, luz y estilo. El modelo inventa el aspecto de todo.
  • I2V (imagen a vídeo) — aportas una imagen fija que define el aspecto, y el prompt describe solo lo que sucede: el movimiento y el desplazamiento de cámara.

La diferencia importa porque cambia para qué sirven tus palabras. En T2V el prompt es el storyboard completo. En I2V es una nota de movimiento pegada a una imagen que ya elegiste.

La fórmula de seis partes del prompt T2V

Cada prompt T2V sólido responde a seis preguntas, en este orden aproximado:

  1. Sujeto — quién o qué aparece en pantalla, con detalles concretos (no "una persona", sino "un farero con abrigo encerado").
  2. Acción — una acción principal por toma. Apilar tres acciones suele dar una mezcla borrosa de todas.
  3. Ambiente y hora — dónde, qué hora del día y qué tiempo. La hora del día condiciona más la paleta que cualquier palabra de estilo.
  4. Cámara — tamaño del plano (primer plano, general...), ángulo (a la altura de los ojos, contrapicado...), movimiento (fija, panorámica, dolly, cámara en mano...). Nombrar solo uno de estos evita que el modelo adivine.
  5. Luz y color — el aspecto de la luz: hora dorada, hora azul, neón, luz de vela; y una dirección de color como teal & orange o monocromo.
  6. Estilo y ánimo — el lenguaje visual (cine, documental, anime, noir) y el tono emocional (melancólico, tenso, lúdico).

Ejemplo resuelto

Ensamblado con las seis partes anteriores:

"plano medio desde la cintura, un farero con abrigo encerado caminando por un muro de defensa, olas rompiendo a su paso, atardecer con viento en el abrigo, plano de seguimiento que acompaña al sujeto, luz de hora azul con un único brillo cálido de lámpara, aspecto de cine, ánimo melancólico"

Cuéntalo: tamaño de plano + sujeto + acción + escenario + hora + movimiento + luz + estilo + ánimo. Cada cláusula cumple una función; ninguna es adorno.

El vocabulario de cámara que entienden los modelos de vídeo

Los modelos de vídeo se entrenan con material anotado con terminología de rodaje, por lo que los términos cinematográficos estándar funcionan. Las palabras que más usarás:

  • Tamaño del plano — primer plano extremo, primer plano, primer plano medio, plano medio, plano medio amplio, plano completo, plano general, plano general extremo, plano cenital, plano a dos.
  • Ángulo — a la altura de los ojos, contrapicado, picado, cenital, mirada de hormiga, neerlandés (dutch angle), sobre el hombro, punto de vista (POV).
  • Movimiento — fija, panorámica, tilt, dolly in, dolly out, seguimiento, órbita, grúa, cámara en mano, zoom.
  • Ritmo — cámara lenta, tiempo real, cámara rápida, timelapse. Nombrar el ritmo es una de las palancas menos usadas: "cámara lenta" por sí sola puede transformar un clip.

No necesitas nombrarlos todos. Una sola decisión de cámara — "plano de seguimiento" o "cámara en mano" — suele mover el resultado más que tres adjetivos de estilo.

Cómo funcionan los prompts I2V

En el modo imagen a vídeo, la imagen fija ya es la mitad del prompt. La imagen define el sujeto, el escenario, la paleta y gran parte del estilo; tu texto debe describir solo el movimiento y la cámara:

  • Qué sucede: "las olas empiezan a llegar, la figura enciende una lámpara".
  • Cómo se comporta la cámara: "dolly in lento", "cámara fija, se mueve el sujeto", "seguimiento con cámara en mano".
  • Ritmo: "cámara lenta" o "tiempo real".

Mantén la descripción corta — una o dos frases suelen bastar. Si vuelves a describir el contenido de la imagen con palabras, el modelo mezcla tu texto con la foto y el resultado deriva de ambas. El Generador de prompts de vídeo IA añade el prefijo "Following the input image" en este modo y oculta las categorías que la imagen ya decide, como el tamaño del plano y la composición.

Adaptar el prompt al modelo

Los principales modelos de vídeo provienen de distintos laboratorios: Kling (Kuaishou), Seedance (ByteDance), Hailuo (MiniMax), Wan 2.2 (Alibaba) y Vidu (Shengshu Technology), además de Sora 2 (OpenAI), Veo 3 (Google), Runway Gen-4 (Runway), Luma Dream Machine (Luma AI) y Pika 2.2 (Pika). Sus estrategias de prompting difieren de dos formas prácticas:

  • Idioma. Los modelos chinos son nativos en chino — los prompts en chino se les leen con más naturalidad; el resto se entrenó sobre todo en inglés. Escribe el prompt en el idioma en que el modelo es más fuerte.
  • Frase de calidad. Cada modelo tiene una frase de cierre preferida — a Kling le va bien "calidad cinematográfica, luces y sombras delicadas, rico detalle", a Pika 2.2 "cinematic, vibrant, smooth motion, crisp detail". Añadir la correcta hace que la misma selección se lea como un prompt nativo para cada modelo.

El generador se encarga de ambas cosas: ajusta el idioma de salida al modelo (chino para los modelos chinos en el sitio chino, inglés en todas las demás combinaciones) y añade el sufijo de calidad propio de cada modelo.

Siete errores que arruinan los prompts de vídeo IA

  • Sujeto vago. "Alguien en algún sitio" deja que el modelo invente al reparto; sé concreto sobre quién o qué aparece.
  • Varias acciones. Apilar tres acciones produce una mezcla borrosa; una acción por clip.
  • Estilos en conflicto. "Documental con cámara en mano" y "aspecto de estudio glamuroso" se anulan; elige un solo lenguaje visual.
  • Sin intención de cámara. Sin tamaño de plano ni movimiento, el modelo adivina; decláralo explícitamente.
  • Sobrecarga. Un párrafo de 200 palabras diluye cada instrucción; 30-80 palabras de descriptores concretos suelen batir a un ensayo largo.
  • Idiomas mezclados. Mantén el prompt en un solo idioma; los prompts medio traducidos confunden al modelo.
  • Ignorar el ritmo. Si quieres cámara lenta o timelapse, dilo; el tiempo real es el predeterminado silencioso.

Construye prompts con estructura

En lugar de texto libre, puedes elegir opciones de una rejilla estructurada. El Generador de prompts de vídeo IA cubre 11 categorías — tamaño de plano, ángulo y movimiento de cámara, ritmo del movimiento, hora y clima, luz, gradación de color, estilo, ánimo, efectos y composición — con imágenes de referencia para cada opción, y ensambla tu selección única por categoría en un prompt ajustado al modelo objetivo. Funciona enteramente en el navegador: nada de lo que escribes se sube.

Herramientas Relacionadas

Preguntas Frecuentes

¿Qué es un prompt texto a vídeo (T2V)?

Un prompt T2V es la descripción de texto completa que un modelo de texto a vídeo convierte en un clip. Como el modelo no ve ninguna imagen, el prompt debe especificar el sujeto, la acción, el ambiente, la cámara (tamaño del plano, ángulo, movimiento), la luz y el estilo: todo lo que un storyboard contendría normalmente.

¿Cómo difiere un prompt imagen a vídeo (I2V)?

En I2V la imagen de entrada ya fija el aspecto, el escenario y la paleta. El prompt solo describe lo que sucede: el movimiento, el ritmo y cualquier desplazamiento de cámara. Volver a describir el contenido de la imagen con palabras suele hacer que el modelo se desvíe de ella.

¿Qué debe incluir un prompt de vídeo IA?

Seis partes: sujeto, una acción principal, ambiente con hora del día y clima, cámara (tamaño del plano, ángulo, movimiento), luz y color, y estilo con ánimo. Límitalo a unas 30-80 palabras de descriptores concretos, en un solo idioma.

¿De qué longitud debe ser un prompt de vídeo IA?

Más largo no es mejor. Alrededor de 30-80 palabras de descriptores concretos y sin ambigüedades es el punto dulce: suficiente para fijar la toma, y lo bastante corto como para que ningún detalle se diluya. Un párrafo de 200 palabras suele funcionar peor que uno ajustado.

¿Necesito un prompt distinto para cada modelo (Kling, Sora 2, Veo 3)?

La descripción central puede seguir siendo la misma, pero dos cosas deben adaptarse: el idioma (los modelos chinos como Kling, Seedance, Hailuo, Wan y Vidu se entrenan para responder a prompts en chino; el resto responde mejor en inglés) y la frase de calidad final, que varía por modelo. Un generador estructurado maneja ambas automáticamente.

Artículos Relacionados