Pourquoi le prompt est tout dans l'image IA
Les modèles texte en image (T2I) ne « comprennent » pas votre idée : ils rapprochent vos mots des patterns des milliards d'images sur lesquelles ils ont été entraînés. Le prompt est la seule instruction qu'ils reçoivent, et de petits choix de formulation changent ce qu'ils peignent. « Un chien dans un parc » et « un terrier broussailleux bondissant après une balle de tennis, lumière tamisée à travers les arbres, objectif 85 mm, faible profondeur de champ » produisent deux images complètement différentes avec le même modèle.
Ce guide couvre la structure qui fonctionne : la formule T2I en huit parties, le vocabulaire visuel auquel les modèles répondent, comment adapter un même prompt au modèle utilisé, et les erreurs qui aplatissent le résultat.
La formule du prompt T2I en huit parties
Chaque bon prompt T2I répond, à peu près dans cet ordre, à huit questions :
- Sujet — qui ou quoi est dans le cadre, avec des détails concrets (pas « une personne » mais « un vieux pêcheur échaudé par le soleil, veste de toile »).
- Détails — les matières et textures qui le rendent concret : trame du tissu, fourrure, peau, patine du métal.
- Scène et moment — où c'est, et l'ambiance : une ruelle, un studio, une côte. L'heure et la météo orientent la palette plus que tout mot de style.
- Composition — l'organisation du cadre : règle des tiers, centré, lignes de fuite, espace négatif, cadre dans le cadre.
- Lumière — le caractère de la lumière : heure dorée, contre-jour, rayons volumétriques, néons, bougies, lumière douce de studio, clair-obscur.
- Couleur — la direction de la palette : teal et orange, tons terreux atténués, pastels, monochrome, tons joyaux.
- Style, medium et ambiance — le langage visuel (photoréaliste, cinématographique, anime, huile, pixel art) et le ton émotionnel (dramatique, paisible, mélancolique).
- Caméra et format — taille du plan (gros plan, plan américain, très grand plan), focale (35 mm, 85 mm), angle et le format dont vous avez réellement besoin.
Exemple résolu
Assemblé à partir des huit parties ci-dessus, un portrait photoréaliste :
"un vieux pêcheur au visage tanné par le soleil, veste de toile épicée de sel, debout au bout d'une petite jetée à l'aube, brume remontant de l'eau, composition centrée avec espace négatif au-dessus, lumière douce d'heure dorée venant de la gauche, tons terreux atténués, photographie photoréaliste, ambiance mélancolique, objectif portrait 85 mm, plan rapproché moyen, 4:5"
Comptez : sujet, texture, lieu, heure, brume, composition, lumière, couleur, style, medium, ambiance, focale, plan et format — quatorze éléments, chaque clause fait un travail, rien de décoratif. Une courte phrase de qualité à la fin — « ultra-détaillé, éclairage naturel » — est lue par le modèle comme une cible de qualité.
Le vocabulaire visuel que les modèles d'image comprennent
Les modèles d'image sont entraînés sur des photos et des œuvres annotées avec une terminologie technique, donc les termes standards fonctionnent. Ceux que vous utiliserez le plus :
- Taille du plan — gros plan serré, gros plan, plan moyen, plan américain, plan large, très grand plan, vue plongeante, par-dessus l'épaule, plan à deux.
- Angle — hauteur des yeux, contre-plongée, plongée, vue aérienne, vue depuis le sol, néerlandaise, POV.
- Focale et profondeur — 24 mm grand angle, 35 mm rue, 50 mm, 85 mm portrait, 135 mm télé, macro 1:1 ; faible profondeur de champ avec bokeh onctueux à f/1.4, ou f/16 pour tout net.
- Lumière — heure dorée, heure bleue, contre-jour, rim light, lumière volumétrique, god rays, néons, bougies, clair de lune, high-key, low-key, lumière Rembrandt, clair-obscur, ombre dramatique.
- Film et texture — photographie sur pellicule 35 mm, Kodak Portra 400, grain de film, fuite de lumière, flash direct d'appareil compact, plan VHS.
- Medias artistiques — huile en impasto, aquarelle, crayon de charbon, lavis d'encre, crayons de couleur, pixel art, art isométrique, anime cell-shaded, trame de bande dessinée, pop art, gravure ukiyo-e, glitch art.
Pas besoin de tout nommer. Un ou deux choix techniques — « objectif portrait 85 mm, faible profondeur de champ » ou « huile en impasto » — déplacent souvent plus le résultat que trois adjectifs de style.
Adapter le prompt au modèle
Les grands modèles d'image viennent de laboratoires différents : Midjourney V7 (Midjourney), DALL·E 3 (OpenAI), Flux.1 (Black Forest Labs), Imagen 3 (Google) et Stable Diffusion 3.5 (Stability AI), plus les modèles chinois Seedream (ByteDance), Kolors (Kuaishou), Wan et Z-Image Turbo (Alibaba), MiniMax Image et ERNIE ViLG (Baidu). Leurs stratégies de prompting diffèrent de deux façons pratiques :
- Langue. Les modèles chinois sont natifs en chinois — un prompt en chinois leur est le plus naturel ; le reste a été entraîné surtout en anglais. Écrivez dans la langue où le modèle est le plus fort.
- Phrase de qualité. Chaque modèle a sa formule de fin préférée — Flux.1 « photorealistic, accurate detail », Midjourney V7 « cinematic, highly detailed, artistic composition ». Ajouter la bonne rend la même sélection lisible comme prompt natif pour chaque modèle.
Le Générateur de prompts image IA gère les deux : il aligne la langue de sortie sur le modèle (chinois pour les modèles chinois sur la page chinoise, anglais partout ailleurs) et ajoute le suffixe de qualité propre à chaque modèle.
Sept erreurs qui aplatissent l'image IA
- Sujet vague. « Quelqu'un quelque part » laisse le modèle inventer le protagoniste ; soyez concret sur qui ou quoi est dans le cadre.
- Styles contradictoires. « Huile photoréaliste » s'annule ; choisissez un langage visuel et tenez-le.
- Pas d'intention de lumière. Sans direction de lumière, le modèle retombe sur une lumière plate, neutre, de catalogue ; nommez votre lumière.
- Soupe d'adjectifs. Vingt mots de style diluent chaque instruction ; dix descripteurs concrets battent souvent cinquante adjectifs.
- Langues mélangées. Gardez le prompt dans une langue ; un prompt mi-traduit embrouille le modèle.
- Format ignoré. Le carré par défaut ne va pas à une image de fond, une bannière ou une couverture — déclarez 16:9, 4:5 ou 3:2 d'emblée.
- Négations au lieu d'affirmations. « Pas de flou, pas de doigts en trop » marche moins bien que décrire ce que vous voulez : mise au point nette, mains propres, un seul sujet.
Construire des prompts avec structure
Au lieu du texte libre, vous pouvez choisir des options dans une grille structurée. Le Générateur de prompts image IA couvre dix catégories — type de sujet, scène, composition, lumière, palette de couleurs, style artistique, medium, ambiance, caméra et format — avec une image de référence pour chaque option, et assemble votre choix unique par catégorie en un prompt ajusté au modèle cible. Il fonctionne entièrement dans le navigateur : rien de ce que vous écrivez n'est téléversé.