🧰 UtlKit

Comment Écrire des Prompts Image IA : Structure T2I, Vocabulaire Visuel et Exemples

Comment écrire des prompts pour les modèles texte en image : structure en huit parties, vocabulaire visuel, exemples résolus et erreurs à éviter.

Pourquoi le prompt est tout dans l'image IA

Les modèles texte en image (T2I) ne « comprennent » pas votre idée : ils rapprochent vos mots des patterns des milliards d'images sur lesquelles ils ont été entraînés. Le prompt est la seule instruction qu'ils reçoivent, et de petits choix de formulation changent ce qu'ils peignent. « Un chien dans un parc » et « un terrier broussailleux bondissant après une balle de tennis, lumière tamisée à travers les arbres, objectif 85 mm, faible profondeur de champ » produisent deux images complètement différentes avec le même modèle.

Ce guide couvre la structure qui fonctionne : la formule T2I en huit parties, le vocabulaire visuel auquel les modèles répondent, comment adapter un même prompt au modèle utilisé, et les erreurs qui aplatissent le résultat.

La formule du prompt T2I en huit parties

Chaque bon prompt T2I répond, à peu près dans cet ordre, à huit questions :

  1. Sujet — qui ou quoi est dans le cadre, avec des détails concrets (pas « une personne » mais « un vieux pêcheur échaudé par le soleil, veste de toile »).
  2. Détails — les matières et textures qui le rendent concret : trame du tissu, fourrure, peau, patine du métal.
  3. Scène et moment — où c'est, et l'ambiance : une ruelle, un studio, une côte. L'heure et la météo orientent la palette plus que tout mot de style.
  4. Composition — l'organisation du cadre : règle des tiers, centré, lignes de fuite, espace négatif, cadre dans le cadre.
  5. Lumière — le caractère de la lumière : heure dorée, contre-jour, rayons volumétriques, néons, bougies, lumière douce de studio, clair-obscur.
  6. Couleur — la direction de la palette : teal et orange, tons terreux atténués, pastels, monochrome, tons joyaux.
  7. Style, medium et ambiance — le langage visuel (photoréaliste, cinématographique, anime, huile, pixel art) et le ton émotionnel (dramatique, paisible, mélancolique).
  8. Caméra et format — taille du plan (gros plan, plan américain, très grand plan), focale (35 mm, 85 mm), angle et le format dont vous avez réellement besoin.

Exemple résolu

Assemblé à partir des huit parties ci-dessus, un portrait photoréaliste :

"un vieux pêcheur au visage tanné par le soleil, veste de toile épicée de sel, debout au bout d'une petite jetée à l'aube, brume remontant de l'eau, composition centrée avec espace négatif au-dessus, lumière douce d'heure dorée venant de la gauche, tons terreux atténués, photographie photoréaliste, ambiance mélancolique, objectif portrait 85 mm, plan rapproché moyen, 4:5"

Comptez : sujet, texture, lieu, heure, brume, composition, lumière, couleur, style, medium, ambiance, focale, plan et format — quatorze éléments, chaque clause fait un travail, rien de décoratif. Une courte phrase de qualité à la fin — « ultra-détaillé, éclairage naturel » — est lue par le modèle comme une cible de qualité.

Le vocabulaire visuel que les modèles d'image comprennent

Les modèles d'image sont entraînés sur des photos et des œuvres annotées avec une terminologie technique, donc les termes standards fonctionnent. Ceux que vous utiliserez le plus :

  • Taille du plan — gros plan serré, gros plan, plan moyen, plan américain, plan large, très grand plan, vue plongeante, par-dessus l'épaule, plan à deux.
  • Angle — hauteur des yeux, contre-plongée, plongée, vue aérienne, vue depuis le sol, néerlandaise, POV.
  • Focale et profondeur — 24 mm grand angle, 35 mm rue, 50 mm, 85 mm portrait, 135 mm télé, macro 1:1 ; faible profondeur de champ avec bokeh onctueux à f/1.4, ou f/16 pour tout net.
  • Lumière — heure dorée, heure bleue, contre-jour, rim light, lumière volumétrique, god rays, néons, bougies, clair de lune, high-key, low-key, lumière Rembrandt, clair-obscur, ombre dramatique.
  • Film et texture — photographie sur pellicule 35 mm, Kodak Portra 400, grain de film, fuite de lumière, flash direct d'appareil compact, plan VHS.
  • Medias artistiques — huile en impasto, aquarelle, crayon de charbon, lavis d'encre, crayons de couleur, pixel art, art isométrique, anime cell-shaded, trame de bande dessinée, pop art, gravure ukiyo-e, glitch art.

Pas besoin de tout nommer. Un ou deux choix techniques — « objectif portrait 85 mm, faible profondeur de champ » ou « huile en impasto » — déplacent souvent plus le résultat que trois adjectifs de style.

Adapter le prompt au modèle

Les grands modèles d'image viennent de laboratoires différents : Midjourney V7 (Midjourney), DALL·E 3 (OpenAI), Flux.1 (Black Forest Labs), Imagen 3 (Google) et Stable Diffusion 3.5 (Stability AI), plus les modèles chinois Seedream (ByteDance), Kolors (Kuaishou), Wan et Z-Image Turbo (Alibaba), MiniMax Image et ERNIE ViLG (Baidu). Leurs stratégies de prompting diffèrent de deux façons pratiques :

  • Langue. Les modèles chinois sont natifs en chinois — un prompt en chinois leur est le plus naturel ; le reste a été entraîné surtout en anglais. Écrivez dans la langue où le modèle est le plus fort.
  • Phrase de qualité. Chaque modèle a sa formule de fin préférée — Flux.1 « photorealistic, accurate detail », Midjourney V7 « cinematic, highly detailed, artistic composition ». Ajouter la bonne rend la même sélection lisible comme prompt natif pour chaque modèle.

Le Générateur de prompts image IA gère les deux : il aligne la langue de sortie sur le modèle (chinois pour les modèles chinois sur la page chinoise, anglais partout ailleurs) et ajoute le suffixe de qualité propre à chaque modèle.

Sept erreurs qui aplatissent l'image IA

  • Sujet vague. « Quelqu'un quelque part » laisse le modèle inventer le protagoniste ; soyez concret sur qui ou quoi est dans le cadre.
  • Styles contradictoires. « Huile photoréaliste » s'annule ; choisissez un langage visuel et tenez-le.
  • Pas d'intention de lumière. Sans direction de lumière, le modèle retombe sur une lumière plate, neutre, de catalogue ; nommez votre lumière.
  • Soupe d'adjectifs. Vingt mots de style diluent chaque instruction ; dix descripteurs concrets battent souvent cinquante adjectifs.
  • Langues mélangées. Gardez le prompt dans une langue ; un prompt mi-traduit embrouille le modèle.
  • Format ignoré. Le carré par défaut ne va pas à une image de fond, une bannière ou une couverture — déclarez 16:9, 4:5 ou 3:2 d'emblée.
  • Négations au lieu d'affirmations. « Pas de flou, pas de doigts en trop » marche moins bien que décrire ce que vous voulez : mise au point nette, mains propres, un seul sujet.

Construire des prompts avec structure

Au lieu du texte libre, vous pouvez choisir des options dans une grille structurée. Le Générateur de prompts image IA couvre dix catégories — type de sujet, scène, composition, lumière, palette de couleurs, style artistique, medium, ambiance, caméra et format — avec une image de référence pour chaque option, et assemble votre choix unique par catégorie en un prompt ajusté au modèle cible. Il fonctionne entièrement dans le navigateur : rien de ce que vous écrivez n'est téléversé.

Outils Associés

Questions Fréquentes

Qu'est-ce qu'un prompt texte en image (T2I) ?

L'ensemble des mots que vous donnez au modèle d'image pour décrire ce qu'il doit peindre : le sujet plus la direction visuelle — scène, composition, lumière, couleur, style, caméra, format. Contrairement à une requête de recherche, l'ordre et la précision comptent : plus un détail est concret et placé tôt, plus le modèle lui accorde de poids.

Que doit contenir un prompt image IA ?

Huit éléments : un sujet concret, des détails de texture et de matière, la scène avec l'heure, la composition, la lumière, la palette de couleurs, le style avec le medium et l'ambiance, et la caméra avec le format. Limitez-vous à 30 à 80 descripteurs concrets dans une seule langue, et terminez par une courte phrase de qualité.

Quelle doit être la longueur d'un prompt image IA ?

Ça dépend du modèle : Midjourney et DALL·E fonctionnent mieux avec des prompts concis (20 à 40 mots environ), tandis que Flux et Stable Diffusion récompensent plus de détails et encaissent plus de 100. En règle générale, 30 à 80 mots de descripteurs concrets et sans ambiguïté constituent le bon point ; un paragraphe de 200 mots fonctionne en général moins bien.

Faut-il un prompt différent pour chaque modèle (Midjourney, DALL·E, Flux) ?

La description centrale peut rester la même, mais deux points s'adaptent : la langue (les modèles chinois comme Seedream, Kolors, Wan, Z-Image Turbo, MiniMax Image et ERNIE ViLG sont entraînés à répondre aux prompts en chinois ; le reste lit le mieux l'anglais) et la phrase de qualité finale, qui diffère d'un modèle à l'autre. Un générateur structuré gère les deux automatiquement.

Pourquoi mes images IA semblent-elles génériques ou lavées ?

C'est souvent parce que le prompt a laissé les grandes décisions au modèle. Nommez la lumière (la lumière plate et neutre est le défaut silencieux), choisissez un style et coupez les adjectifs en conflit, ajoutez un ou deux détails techniques — objectif, taille du plan, pellicule — et déclarez le format. Dix descripteurs concrets battent souvent une liste d'adjectifs.

Articles Associés