为什么提示词决定一切
文生图(T2I)模型并不"理解"你的想法——它们把你的文字与训练所用的数十亿张图像进行匹配。提示词是它们收到的唯一指令,措辞的细微差别会改变画出的画面。"公园里的一只狗"和"一只毛发蓬乱的梗犬跃起扑网球,阳光穿过树影洒落,85mm 镜头,浅景深"用同一个模型会生成完全不同的两张图。
本文介绍有效的写法:八段式 T2I 提示词结构、图像模型能理解的视觉词汇、如何针对所用模型调整提示词,以及让画面流于平庸的常见错误。
八段式 T2I 提示词公式
每个有效的 T2I 提示词都按大致顺序回答八个问题:
- 主体——画面中是谁或什么,带具体细节(不是"一个人",而是"一位饱经风霜、穿帆布外套的渔夫")。
- 细节——让主体具体化的材质与纹理:织物纹理、毛发、皮肤、金属包浆。
- 场景与时间——地点与氛围:小巷、影棚、海岸。时刻与天气比任何风格词都更决定色调。
- 构图——画面如何组织:三分法、居中、引导线、留白、框中框。
- 光线——光线形态:黄金时刻、轮廓光、体积光束、霓虹、烛光、影棚柔光、明暗对照法。
- 色彩——调色方向:青橙、低饱和大地色、马卡龙色、单色、宝石色。
- 风格、媒介与情绪——视觉语言(写实、电影感、动漫、油画、像素风)与情绪基调(戏剧化、宁静、忧郁)。
- 镜头与画幅——景别(特写、全身、大远景)、焦段(35mm、85mm)、角度,以及你实际需要的画幅比例。
完整实例
按上述八段组装的写实人像:
"一位皮肤被太阳晒得粗糙的老渔夫,帆布外套染着盐渍,站在小码头尽头,清晨水雾从水面升腾,居中构图、上方大面积留白,左侧柔和的黄金时刻侧光,低饱和大地色,写实照片,忧郁氛围,85mm 人像镜头,中近景,4:5"
数一数:主体、质感、地点、时间、雾气、构图、光线、色彩、风格、媒介、情绪、焦段、景别、画幅——十四个要素,每一小句只做一件事,没有一句是装饰。结尾加一句简短的画质短语——"超清细腻,光影自然"——会被模型当作画质目标。
图像模型能理解的视觉词汇
图像模型在与带技术术语标注的照片和画作上训练,因此标准化的术语有效。最常用的词:
- 景别——大特写、特写、中景、全景、远景、大远景、顶视俯拍、过肩、双人镜头。
- 角度——平视、仰拍、俯拍、鸟瞰、虫视、荷兰角、主观视角。
- 焦段与景深——24mm 广角、35mm 街拍、50mm、85mm 人像、135mm 长焦、1:1 微距;浅景深配 f/1.4 奶油虚化,或 f/16 全画面锐利。
- 光线——黄金时刻、蓝调时刻、逆光、轮廓光、体积光、光束、霓虹、烛光、月光、高调、低调、伦勃朗光、明暗对照法、戏剧性阴影。
- 胶片与质感——35mm 胶片照片、Kodak Portra 400、颗粒胶片质感、漏光、傻瓜相机直闪、VHS 录像截图。
- 艺术媒介——厚涂油画、水彩渲染、炭笔素描、墨线、彩铅、像素画、等距画、赛璐璐动画、漫画网点、波普艺术、浮世绘木版、故障艺术。
不必全说。一两个技术决定——"85mm 人像镜头,浅景深"或"厚涂油画"——往往比三个风格形容词的影响更大。
针对模型调整提示词
主流图像模型来自不同厂商:Midjourney V7(Midjourney)、DALL·E 3(OpenAI)、Flux.1(Black Forest Labs)、Imagen 3(Google)、Stable Diffusion 3.5(Stability AI),以及中文模型即梦 Seedream(字节跳动)、可图 Kolors(快手)、万相 Wan 与 Z-Image Turbo(阿里巴巴)、MiniMax Image、文心一格 ERNIE ViLG(百度)。提示策略上有两个实际区别:
- 语言。中文模型以中文为母语——对它们而言中文提示词最自然;其余模型主要用英文训练。用模型最擅长的语言写提示词。
- 画质尾缀。每个模型都有偏好的收尾句——Flux.1 喜欢 "photorealistic, accurate detail",Midjourney V7 则是 "cinematic, highly detailed, artistic composition"。加上正确的一句,同样的选项在每个模型上都会读起来像原生提示词。
AI图像提示词生成器会自动处理这两点:输出语言匹配模型(中文页面上的中文模型输出中文,其余一律英文),并附加各模型自己的画质尾缀。
七个让画面流于平庸的错误
- 主体模糊。"某个地方有个人"会让模型自行想象画面里的人;说清画面中是谁或什么。
- 风格冲突。"写实油画"自我抵消;选一种视觉语言并坚持。
- 没有光线意图。不指明光线方向,模型默认平淡、中性的目录式布光;说出你的光线。
- 形容词堆砌。二十个风格词会稀释每条指令;十个具体描述通常胜过五十个形容词。
- 语言混杂。提示词保持一种语言;半翻译的提示词会让模型困惑。
- 忽视画幅。壁纸、横幅、书封用默认方形是错的——一开始就声明 16:9、4:5 或 3:2。
- 用否定代替肯定。"不要模糊、不要多余手指"不如直接描述你要的:对焦锐利、手部干净、单一主体。
用结构搭建提示词
不必从零写自由文本,可以从结构化选项里挑选。AI图像提示词生成器覆盖 10 个类别——主体类型、场景、构图、光线、色彩、艺术风格、媒介、情绪、镜头、画幅——每个选项都带参考图,把每类别的单选组装成一条针对目标模型调优的完整提示词。全程在浏览器内运行:你写的任何内容都不会被上传。