Por qué el prompt lo es todo en el vídeo IA
Los modelos de texto a vídeo (T2V) e imagen a vídeo (I2V) no "entienden" tu idea: cotejan tus palabras con los patrones del material fílmico con el que se entrenaron. El prompt es la única instrucción que reciben, y pequeñas decisiones de redacción cambian lo que generan. "Un coche en una carretera" y "un coche rojo de época conduciendo por una carretera costera al atardecer, plano de seguimiento" producen dos clips completamente distintos con el mismo modelo.
Esta guía cubre la estructura que funciona: el prompt T2V de seis partes, el vocabulario de cámara al que responden los modelos de vídeo, en qué difieren los prompts I2V y cómo adaptar un prompt al modelo que estés usando.
T2V e I2V: dos modos, dos prompts distintos
- T2V (texto a vídeo) — escribes toda la toma en palabras: sujeto, acción, escenario, cámara, luz y estilo. El modelo inventa el aspecto de todo.
- I2V (imagen a vídeo) — aportas una imagen fija que define el aspecto, y el prompt describe solo lo que sucede: el movimiento y el desplazamiento de cámara.
La diferencia importa porque cambia para qué sirven tus palabras. En T2V el prompt es el storyboard completo. En I2V es una nota de movimiento pegada a una imagen que ya elegiste.
La fórmula de seis partes del prompt T2V
Cada prompt T2V sólido responde a seis preguntas, en este orden aproximado:
- Sujeto — quién o qué aparece en pantalla, con detalles concretos (no "una persona", sino "un farero con abrigo encerado").
- Acción — una acción principal por toma. Apilar tres acciones suele dar una mezcla borrosa de todas.
- Ambiente y hora — dónde, qué hora del día y qué tiempo. La hora del día condiciona más la paleta que cualquier palabra de estilo.
- Cámara — tamaño del plano (primer plano, general...), ángulo (a la altura de los ojos, contrapicado...), movimiento (fija, panorámica, dolly, cámara en mano...). Nombrar solo uno de estos evita que el modelo adivine.
- Luz y color — el aspecto de la luz: hora dorada, hora azul, neón, luz de vela; y una dirección de color como teal & orange o monocromo.
- Estilo y ánimo — el lenguaje visual (cine, documental, anime, noir) y el tono emocional (melancólico, tenso, lúdico).
Ejemplo resuelto
Ensamblado con las seis partes anteriores:
"plano medio desde la cintura, un farero con abrigo encerado caminando por un muro de defensa, olas rompiendo a su paso, atardecer con viento en el abrigo, plano de seguimiento que acompaña al sujeto, luz de hora azul con un único brillo cálido de lámpara, aspecto de cine, ánimo melancólico"
Cuéntalo: tamaño de plano + sujeto + acción + escenario + hora + movimiento + luz + estilo + ánimo. Cada cláusula cumple una función; ninguna es adorno.
El vocabulario de cámara que entienden los modelos de vídeo
Los modelos de vídeo se entrenan con material anotado con terminología de rodaje, por lo que los términos cinematográficos estándar funcionan. Las palabras que más usarás:
- Tamaño del plano — primer plano extremo, primer plano, primer plano medio, plano medio, plano medio amplio, plano completo, plano general, plano general extremo, plano cenital, plano a dos.
- Ángulo — a la altura de los ojos, contrapicado, picado, cenital, mirada de hormiga, neerlandés (dutch angle), sobre el hombro, punto de vista (POV).
- Movimiento — fija, panorámica, tilt, dolly in, dolly out, seguimiento, órbita, grúa, cámara en mano, zoom.
- Ritmo — cámara lenta, tiempo real, cámara rápida, timelapse. Nombrar el ritmo es una de las palancas menos usadas: "cámara lenta" por sí sola puede transformar un clip.
No necesitas nombrarlos todos. Una sola decisión de cámara — "plano de seguimiento" o "cámara en mano" — suele mover el resultado más que tres adjetivos de estilo.
Cómo funcionan los prompts I2V
En el modo imagen a vídeo, la imagen fija ya es la mitad del prompt. La imagen define el sujeto, el escenario, la paleta y gran parte del estilo; tu texto debe describir solo el movimiento y la cámara:
- Qué sucede: "las olas empiezan a llegar, la figura enciende una lámpara".
- Cómo se comporta la cámara: "dolly in lento", "cámara fija, se mueve el sujeto", "seguimiento con cámara en mano".
- Ritmo: "cámara lenta" o "tiempo real".
Mantén la descripción corta — una o dos frases suelen bastar. Si vuelves a describir el contenido de la imagen con palabras, el modelo mezcla tu texto con la foto y el resultado deriva de ambas. El Generador de prompts de vídeo IA añade el prefijo "Following the input image" en este modo y oculta las categorías que la imagen ya decide, como el tamaño del plano y la composición.
Adaptar el prompt al modelo
Los principales modelos de vídeo provienen de distintos laboratorios: Kling (Kuaishou), Seedance (ByteDance), Hailuo (MiniMax), Wan 2.2 (Alibaba) y Vidu (Shengshu Technology), además de Sora 2 (OpenAI), Veo 3 (Google), Runway Gen-4 (Runway), Luma Dream Machine (Luma AI) y Pika 2.2 (Pika). Sus estrategias de prompting difieren de dos formas prácticas:
- Idioma. Los modelos chinos son nativos en chino — los prompts en chino se les leen con más naturalidad; el resto se entrenó sobre todo en inglés. Escribe el prompt en el idioma en que el modelo es más fuerte.
- Frase de calidad. Cada modelo tiene una frase de cierre preferida — a Kling le va bien "calidad cinematográfica, luces y sombras delicadas, rico detalle", a Pika 2.2 "cinematic, vibrant, smooth motion, crisp detail". Añadir la correcta hace que la misma selección se lea como un prompt nativo para cada modelo.
El generador se encarga de ambas cosas: ajusta el idioma de salida al modelo (chino para los modelos chinos en el sitio chino, inglés en todas las demás combinaciones) y añade el sufijo de calidad propio de cada modelo.
Siete errores que arruinan los prompts de vídeo IA
- Sujeto vago. "Alguien en algún sitio" deja que el modelo invente al reparto; sé concreto sobre quién o qué aparece.
- Varias acciones. Apilar tres acciones produce una mezcla borrosa; una acción por clip.
- Estilos en conflicto. "Documental con cámara en mano" y "aspecto de estudio glamuroso" se anulan; elige un solo lenguaje visual.
- Sin intención de cámara. Sin tamaño de plano ni movimiento, el modelo adivina; decláralo explícitamente.
- Sobrecarga. Un párrafo de 200 palabras diluye cada instrucción; 30-80 palabras de descriptores concretos suelen batir a un ensayo largo.
- Idiomas mezclados. Mantén el prompt en un solo idioma; los prompts medio traducidos confunden al modelo.
- Ignorar el ritmo. Si quieres cámara lenta o timelapse, dilo; el tiempo real es el predeterminado silencioso.
Construye prompts con estructura
En lugar de texto libre, puedes elegir opciones de una rejilla estructurada. El Generador de prompts de vídeo IA cubre 11 categorías — tamaño de plano, ángulo y movimiento de cámara, ritmo del movimiento, hora y clima, luz, gradación de color, estilo, ánimo, efectos y composición — con imágenes de referencia para cada opción, y ensambla tu selección única por categoría en un prompt ajustado al modelo objetivo. Funciona enteramente en el navegador: nada de lo que escribes se sube.