🧰 UtlKit

Comment Écrire des Prompts Vidéo IA : Structure T2V et I2V, Langage Caméra et Exemples

Pourquoi le prompt est tout dans la vidéo IA

Les modèles texte en vidéo (T2V) et image en vidéo (I2V) ne « comprennent » pas votre idée : ils mettent vos mots en correspondance avec les motifs des plans filmés sur lesquels ils ont été entraînés. Le prompt est la seule instruction qu'ils reçoivent, et de petits choix de formulation changent ce qu'ils génèrent. « Une voiture sur une route » et « une voiture rouge vintage roulant le long d'une route côtière au crépuscule, plan de suivi » produisent deux clips complètement différents avec le même modèle.

Ce guide couvre la structure qui fonctionne : le prompt T2V en six parties, le vocabulaire caméra auquel les modèles de vidéo répondent, en quoi les prompts I2V diffèrent, et comment adapter un prompt au modèle que vous utilisez.

T2V et I2V : deux modes, deux prompts différents

  • T2V (texte en vidéo) — vous écrivez toute la prise en mots : sujet, action, décor, caméra, lumière, style. Le modèle invente l'apparence de tout.
  • I2V (image en vidéo) — vous fournissez une image fixe qui définit l'apparence, et le prompt décrit seulement ce qui se passe : le mouvement et les déplacements de caméra.

La différence compte parce qu'elle change la fonction de vos mots. En T2V, le prompt est le storyboard complet. En I2V, c'est une note de mouvement attachée à une image que vous avez déjà choisie.

La formule en six parties du prompt T2V

Chaque bon prompt T2V répond à six questions, dans cet ordre approximatif :

  1. Sujet — qui ou quoi est à l'écran, avec des détails concrets (pas « une personne », mais « un gardien de phare en ciré »).
  2. Action — une action principale par plan. Empiler trois actions produit en général un mélange flou des trois.
  3. Environnement et moment — où, à quelle heure, quel temps. L'heure de la journée pèse plus sur la palette que n'importe quel mot de style.
  4. Caméra — taille du plan (gros plan, plan large…), angle (à hauteur d'yeux, contre-plongée…), mouvement (fixe, panoramique, dolly, caméra à l'épaule…). Nommer l'un d'eux suffit à empêcher le modèle de deviner.
  5. Lumière et couleur — l'aspect de la lumière : golden hour, blue hour, néons, lumière de bougie ; et une direction de couleur comme teal & orange ou monochrome.
  6. Style et ambiance — le langage visuel (cinématographique, documentaire, anime, noir) et le ton émotionnel (mélancolique, tendu, ludique).

Exemple résolu

Assemblé à partir des six parties ci-dessus :

« plan américain, un gardien de phare en ciré marchant le long d'une digue, vagues qui se brisent en contrebas, crépuscule avec le vent qui agite le ciré, plan de suivi suivant le sujet, lumière de blue hour avec un unique halo chaud de lanterne, look de film, ambiance mélancolique »

Comptez : taille du plan + sujet + action + décor + heure + mouvement + lumière + style + ambiance. Chaque clause fait un seul travail ; aucune n'est décorative.

Le vocabulaire caméra que les modèles de vidéo comprennent

Les modèles de vidéo sont entraînés sur des plans annotés avec la terminologie du cinéma, donc les termes filmiques standardisés fonctionnent. Les mots que vous utiliserez le plus :

  • Taille du plan — très gros plan, gros plan, gros plan moyen, plan moyen, plan américain, plan complet, plan large, plan d'ensemble, plan zénithal, plan à deux.
  • Angle — à hauteur d'yeux, contre-plongée, plongée, vue d'oiseau, vue de fourmi, angle néerlandais (dutch angle), par-dessus l'épaule, point de vue (POV).
  • Mouvement — fixe, panoramique, tilt, dolly avant, dolly arrière, suivi, orbite, grue, caméra à l'épaule, zoom.
  • Rythme — ralenti, temps réel, accéléré, timelapse. Nommer le rythme est l'un des leviers les moins utilisés : « ralenti » seul peut transformer un clip.

Vous n'avez pas besoin de tout nommer. Une seule décision caméra — « plan de suivi » ou « caméra à l'épaule » — fait souvent plus bouger le résultat que trois adjectifs de style.

Comment fonctionnent les prompts I2V

En mode image en vidéo, l'image fixe est déjà la moitié du prompt. L'image fixe le sujet, le décor, la palette et une bonne partie du style ; votre texte ne doit décrire que le mouvement et la caméra :

  • Ce qui se passe : « les vagues commencent à arriver, la figure allume une lanterne ».
  • Comment la caméra se comporte : « dolly avant lent », « caméra fixe, le sujet bouge », « suivi à l'épaule ».
  • Rythme : « ralenti » ou « temps réel ».

Gardez la description courte — une ou deux phrases suffisent en général. Si vous re-décrivez le contenu de l'image en mots, le modèle mêle votre texte à la photo et le résultat s'éloigne des deux. Le Générateur de prompts vidéo IA ajoute le préfixe « Following the input image » dans ce mode et masque les catégories que l'image décide déjà, comme la taille du plan et la composition.

Adapter le prompt au modèle

Les grands modèles de vidéo viennent de laboratoires différents : Kling (Kuaishou), Seedance (ByteDance), Hailuo (MiniMax), Wan 2.2 (Alibaba) et Vidu (Shengshu Technology), plus Sora 2 (OpenAI), Veo 3 (Google), Runway Gen-4 (Runway), Luma Dream Machine (Luma AI) et Pika 2.2 (Pika). Leurs stratégies de prompting diffèrent de deux façons pratiques :

  • Langue. Les modèles chinois sont natifs en chinois — les prompts en chinois leur sont les plus naturels ; le reste a surtout été entraîné en anglais. Écrivez le prompt dans la langue où le modèle est le plus fort.
  • Phrase de qualité. Chaque modèle a une phrase de finition préférée — Kling aime « qualité cinématographique, lumière et ombre délicates, riches détails », Pika 2.2 « cinematic, vibrant, smooth motion, crisp detail ». Ajouter la bonne fait que la même sélection se lit comme un prompt natif pour chaque modèle.

Le générateur s'occupe des deux : il adapte la langue de sortie au modèle (chinois pour les modèles chinois sur le site chinois, anglais partout ailleurs) et ajoute le suffixe de qualité propre à chaque modèle.

Sept erreurs qui ruinent les prompts vidéo IA

  • Sujet vague. « Quelqu'un quelque part » laisse le modèle inventer le casting ; soyez concret sur qui ou quoi est à l'écran.
  • Plusieurs actions. Empiler trois actions produit un mélange flou ; une action par clip.
  • Styles contradictoires. « Documentaire caméra à l'épaule » et « look de studio glamour » s'annulent ; choisissez un seul langage visuel.
  • Aucune intention caméra. Sans taille de plan ni mouvement, le modèle devine ; déclarez-le explicitement.
  • Trop d'accumulation. Un paragraphe de 200 mots dilue chaque instruction ; 30 à 80 mots de descripteurs concrets battent en général un long essai.
  • Langues mélangées. Gardez le prompt dans une seule langue ; les prompts moitié traduits confondent le modèle.
  • Rythme ignoré. Si vous voulez un ralenti ou un timelapse, dites-le ; le temps réel est le défaut silencieux.

Construisez des prompts avec de la structure

Au lieu du texte libre, vous pouvez choisir des options dans une grille structurée. Le Générateur de prompts vidéo IA couvre 11 catégories — taille du plan, angle et mouvement de caméra, rythme du mouvement, moment et météo, lumière, étalonnage, style, ambiance, effets et composition — avec des images de référence pour chaque option, et assemble votre choix unique par catégorie en un prompt ajusté au modèle cible. Il fonctionne entièrement dans le navigateur : rien de ce que vous écrivez n'est téléversé.

Outils Associés

Questions Fréquentes

Qu'est-ce qu'un prompt texte en vidéo (T2V) ?

Un prompt T2V est la description de texte complète qu'un modèle texte en vidéo transforme en clip. Le modèle ne voyant aucune image, c'est le prompt qui doit préciser le sujet, l'action, l'environnement, la caméra (taille du plan, angle, mouvement), l'éclairage et le style : tout ce qu'un storyboard contiendrait normalement.

En quoi un prompt image en vidéo (I2V) est-il différent ?

En I2V, l'image d'entrée fixe déjà l'apparence, le décor et la palette. Le prompt décrit seulement ce qui se passe : le mouvement, le rythme et les déplacements de caméra. Re-décrire le contenu de l'image en mots provoque généralement une dérive du modèle par rapport à celle-ci.

Que doit contenir un prompt vidéo IA ?

Six parties : sujet, une action principale, environnement avec heure et météo, caméra (taille du plan, angle, mouvement), lumière et couleur, style avec ambiance. Limitez-vous à 30 à 80 mots de descripteurs concrets, dans une seule langue.

Quelle doit être la longueur d'un prompt vidéo IA ?

Plus long n'est pas meilleur. Environ 30 à 80 mots de descripteurs concrets et sans ambiguïté constituent le bon point : assez pour fixer le plan, assez court pour qu'aucun détail ne se dilue. Un paragraphe de 200 mots fonctionne en général moins bien qu'un texte serré.

Faut-il un prompt différent pour chaque modèle (Kling, Sora 2, Veo 3) ?

La description centrale peut rester la même, mais deux points s'adaptent : la langue (les modèles chinois comme Kling, Seedance, Hailuo, Wan et Vidu sont entraînés à répondre aux prompts en chinois ; le reste lit le mieux l'anglais) et la phrase de qualité finale, qui diffère d'un modèle à l'autre. Un générateur structuré gère les deux automatiquement.

Articles Associés