🧰 UtlKit

AI图像提示词撰写指南:T2I结构、视觉词汇与实例

如何为文生图像模型撰写提示词:八段式结构、图像模型能理解的视觉词汇、完整实例和常见错误。

为什么提示词决定一切

文生图(T2I)模型并不"理解"你的想法——它们把你的文字与训练所用的数十亿张图像进行匹配。提示词是它们收到的唯一指令,措辞的细微差别会改变画出的画面。"公园里的一只狗"和"一只毛发蓬乱的梗犬跃起扑网球,阳光穿过树影洒落,85mm 镜头,浅景深"用同一个模型会生成完全不同的两张图。

本文介绍有效的写法:八段式 T2I 提示词结构、图像模型能理解的视觉词汇、如何针对所用模型调整提示词,以及让画面流于平庸的常见错误。

八段式 T2I 提示词公式

每个有效的 T2I 提示词都按大致顺序回答八个问题:

  1. 主体——画面中是谁或什么,带具体细节(不是"一个人",而是"一位饱经风霜、穿帆布外套的渔夫")。
  2. 细节——让主体具体化的材质与纹理:织物纹理、毛发、皮肤、金属包浆。
  3. 场景与时间——地点与氛围:小巷、影棚、海岸。时刻与天气比任何风格词都更决定色调。
  4. 构图——画面如何组织:三分法、居中、引导线、留白、框中框。
  5. 光线——光线形态:黄金时刻、轮廓光、体积光束、霓虹、烛光、影棚柔光、明暗对照法。
  6. 色彩——调色方向:青橙、低饱和大地色、马卡龙色、单色、宝石色。
  7. 风格、媒介与情绪——视觉语言(写实、电影感、动漫、油画、像素风)与情绪基调(戏剧化、宁静、忧郁)。
  8. 镜头与画幅——景别(特写、全身、大远景)、焦段(35mm、85mm)、角度,以及你实际需要的画幅比例。

完整实例

按上述八段组装的写实人像:

"一位皮肤被太阳晒得粗糙的老渔夫,帆布外套染着盐渍,站在小码头尽头,清晨水雾从水面升腾,居中构图、上方大面积留白,左侧柔和的黄金时刻侧光,低饱和大地色,写实照片,忧郁氛围,85mm 人像镜头,中近景,4:5"

数一数:主体、质感、地点、时间、雾气、构图、光线、色彩、风格、媒介、情绪、焦段、景别、画幅——十四个要素,每一小句只做一件事,没有一句是装饰。结尾加一句简短的画质短语——"超清细腻,光影自然"——会被模型当作画质目标。

图像模型能理解的视觉词汇

图像模型在与带技术术语标注的照片和画作上训练,因此标准化的术语有效。最常用的词:

  • 景别——大特写、特写、中景、全景、远景、大远景、顶视俯拍、过肩、双人镜头。
  • 角度——平视、仰拍、俯拍、鸟瞰、虫视、荷兰角、主观视角。
  • 焦段与景深——24mm 广角、35mm 街拍、50mm、85mm 人像、135mm 长焦、1:1 微距;浅景深配 f/1.4 奶油虚化,或 f/16 全画面锐利。
  • 光线——黄金时刻、蓝调时刻、逆光、轮廓光、体积光、光束、霓虹、烛光、月光、高调、低调、伦勃朗光、明暗对照法、戏剧性阴影。
  • 胶片与质感——35mm 胶片照片、Kodak Portra 400、颗粒胶片质感、漏光、傻瓜相机直闪、VHS 录像截图。
  • 艺术媒介——厚涂油画、水彩渲染、炭笔素描、墨线、彩铅、像素画、等距画、赛璐璐动画、漫画网点、波普艺术、浮世绘木版、故障艺术。

不必全说。一两个技术决定——"85mm 人像镜头,浅景深"或"厚涂油画"——往往比三个风格形容词的影响更大。

针对模型调整提示词

主流图像模型来自不同厂商:Midjourney V7(Midjourney)、DALL·E 3(OpenAI)、Flux.1(Black Forest Labs)、Imagen 3(Google)、Stable Diffusion 3.5(Stability AI),以及中文模型即梦 Seedream(字节跳动)、可图 Kolors(快手)、万相 Wan 与 Z-Image Turbo(阿里巴巴)、MiniMax Image、文心一格 ERNIE ViLG(百度)。提示策略上有两个实际区别:

  • 语言。中文模型以中文为母语——对它们而言中文提示词最自然;其余模型主要用英文训练。用模型最擅长的语言写提示词。
  • 画质尾缀。每个模型都有偏好的收尾句——Flux.1 喜欢 "photorealistic, accurate detail",Midjourney V7 则是 "cinematic, highly detailed, artistic composition"。加上正确的一句,同样的选项在每个模型上都会读起来像原生提示词。

AI图像提示词生成器会自动处理这两点:输出语言匹配模型(中文页面上的中文模型输出中文,其余一律英文),并附加各模型自己的画质尾缀。

七个让画面流于平庸的错误

  • 主体模糊。"某个地方有个人"会让模型自行想象画面里的人;说清画面中是谁或什么。
  • 风格冲突。"写实油画"自我抵消;选一种视觉语言并坚持。
  • 没有光线意图。不指明光线方向,模型默认平淡、中性的目录式布光;说出你的光线。
  • 形容词堆砌。二十个风格词会稀释每条指令;十个具体描述通常胜过五十个形容词。
  • 语言混杂。提示词保持一种语言;半翻译的提示词会让模型困惑。
  • 忽视画幅。壁纸、横幅、书封用默认方形是错的——一开始就声明 16:9、4:5 或 3:2。
  • 用否定代替肯定。"不要模糊、不要多余手指"不如直接描述你要的:对焦锐利、手部干净、单一主体。

用结构搭建提示词

不必从零写自由文本,可以从结构化选项里挑选。AI图像提示词生成器覆盖 10 个类别——主体类型、场景、构图、光线、色彩、艺术风格、媒介、情绪、镜头、画幅——每个选项都带参考图,把每类别的单选组装成一条针对目标模型调优的完整提示词。全程在浏览器内运行:你写的任何内容都不会被上传。

相关工具

常见问题

什么是文生图(T2I)提示词?

交给图像模型、描述要画什么的文字:主体加上视觉方向——场景、构图、光线、色彩、风格、镜头、画幅。与搜索词不同,顺序与具体程度都起作用:细节越具体、出现得越靠前,模型赋予的权重越大。

AI 图像提示词应包含什么?

八个要素:具体的主体、材质纹理细节、带时刻的场景、构图、光线、色彩、带媒介与情绪的风格,以及带画幅的镜头。保持 30-80 字具体描述、单一语言,以一句简短画质短语收尾。

AI 图像提示词应该多长?

取决于模型:Midjourney 和 DALL·E 偏好简洁提示词(约 20-40 字),而 Flux 与 Stable Diffusion 奖励更多细节,可容纳 100 字以上。一般规则:30-80 字具体、无歧义的描述是最佳区间;200 字的段落通常效果更差。

每个模型(Midjourney、DALL·E、Flux)都需要不同的提示词吗?

核心描述可以保持不变,但有两点应做调整:语言(Seedream、Kolors、Wan、Z-Image Turbo、MiniMax Image、ERNIE ViLG 等中文模型按中文提示词训练响应,其余模型最擅长英文)和收尾的画质句(每个模型不同)。结构化生成器会自动处理这两点。

为什么我的 AI 图像看起来平庸或发灰?

通常是提示词把大决定留给了模型。说出光线(平淡、中性光才是无声的默认值),选一种风格并删掉冲突的形容词,加一两个技术细节——镜头、景别、胶片——并声明画幅。十个具体描述通常胜过一列形容词。

相关文章