为什么提示词决定一切
文生视频(T2V)和图生视频(I2V)模型并不"理解"你的想法——它们把你的文字与训练所用的影片素材进行匹配。提示词是它们收到的唯一指令,措辞的细微差别会改变生成结果。"路上有一辆车"和"一辆红色老式汽车沿海岸公路行驶,金色时刻,跟拍镜头"会用同一个模型生成完全不同的两个片段。
本文介绍有效的写法:六段式 T2V 提示词结构、视频模型能理解的镜头语言词汇、I2V 提示词的不同之处,以及如何针对所用模型调整提示词。
T2V 与 I2V:两种模式,两种提示词
- T2V(文生视频)——用文字写完整镜头:主体、动作、场景、镜头、光线、风格,模型自行想象一切的外观。
- I2V(图生视频)——你提供一张固定外观的静帧图片,提示词只描述发生什么:运动与镜头运动。
这一区别很重要,因为它改变了文字的作用。T2V 中提示词就是完整的分镜稿;I2V 中它是附加在你已选图片上的一段运动说明。
六段式 T2V 提示词公式
每个有效的 T2V 提示词都按大致顺序回答六个问题:
- 主体——画面中是谁或什么,带具体细节(不是"一个人",而是"一位穿蜡布外套的灯塔看守人")。
- 动作——每个镜头一个主要动作。堆叠三个动作通常得到糊成一团的混合。
- 环境与时间——地点、一天中的时刻、天气。时刻比任何风格词都更决定色调。
- 镜头——景别(特写、全景……)、角度(平视、仰拍……)、运动(固定、横摇、推轨、手持……)。只说出其中一项,也能阻止模型瞎猜。
- 光线与色彩——光线形态:黄金时刻、蓝调时刻、霓虹、烛光;以及青橙、单色这类色彩方向。
- 风格与情绪——视觉语言(电影感、纪录片、动漫、黑色电影)和情绪基调(忧郁、紧张、欢快)。
完整实例
按上述六段组装:
"中景(腰部以上),一位穿蜡布外套的灯塔看守人沿海堤行走,下方浪涛拍打,黄昏风卷动外套,跟拍镜头跟随主体,蓝调时刻的光线与一点暖黄灯光,电影胶片质感,忧郁的氛围"
九个要素一句不缺,每一小句只做一件事,没有一句是装饰。
视频模型能理解的镜头语言
视频模型在与带镜头术语标注的影片素材上训练,因此标准化的电影术语有效。最常用的词:
- 景别——大特写、特写、中近景、中景、中全景、全景、远景、大远景、顶视俯拍、双人镜头。
- 角度——平视、仰拍、俯拍、鸟瞰、虫视、倾斜角度(荷兰角)、过肩、主观视角。
- 运动——固定、横摇、俯仰摇移、推轨、拉轨、跟拍、环绕、摇臂、手持、变焦。
- 节奏——慢动作、实时、快动作、延时摄影。点明节奏是被低估最强的杠杆之一:只加"慢动作"一词就能改变整个片段。
不必全说。一个镜头决定——"跟拍"或"手持"——往往比三个风格形容词的影响更大。
I2V 提示词怎么写
图生视频模式下,静帧图片已经承担了提示词的一半。图片固定了主体、场景、色调和大部分风格,文字只描述运动与镜头:
- 发生什么:"海浪开始涌来,人物举起灯笼。"
- 镜头如何运动:"缓慢推轨"、"固定机位,主体运动"、"手持跟拍"。
- 节奏:"慢动作"或"实时"。
描述要短——通常一两句就够。如果再用文字复述图片内容,模型会把你的文字和照片混合,结果两边都不像。AI视频提示词生成器在该模式下自动加上前导语(中文模型为「延续输入画面」,其余模型为 "Following the input image"),并隐藏已由图片决定的类别(景别、镜头角度、构图)。
针对模型调整提示词
主流视频模型来自不同厂商:Kling(快手)、Seedance(字节跳动)、Hailuo(MiniMax)、Wan 2.2(阿里巴巴)、Vidu(生数科技),以及 Sora 2(OpenAI)、Veo 3(Google)、Runway Gen-4(Runway)、Luma Dream Machine(Luma AI)、Pika 2.2(Pika)。提示策略上有两个实际区别:
- 语言。中文模型以中文为母语——对它们而言中文提示词最自然;其余模型主要用英文训练。用模型最擅长的语言写提示词。
- 画质尾缀。每个模型都有偏好的收尾句——Kling 喜欢「电影级画质,光影细腻,细节丰富」,Pika 2.2 则是 "cinematic, vibrant, smooth motion, crisp detail"。加上正确的一句,同样的选项在每个模型上都会读起来像原生提示词。
生成器会自动处理这两点:按所选模型匹配输出语言(中文页面选择中文模型时输出中文,其余情况一律英文),并附上该模型自己的画质尾缀。
毁掉 AI 视频提示词的七个错误
- 主体模糊。"某处有个人"会让模型自行想象主角;把画面中是谁或什么写具体。
- 多个动作。堆叠三个动作会得到糊成一团的混合;每条片段一个动作。
- 风格冲突。"纪录片手持"和"华丽棚拍质感"会互相抵消;只选一种视觉语言。
- 没有镜头意图。不给景别或运动,模型只能猜;明确写出来。
- 过度堆砌。200 字的段落会稀释每条指令;30-80 字的具体描述通常胜过长文。
- 语言混杂。提示词保持单一语言;半翻译的提示词会让模型困惑。
- 忽略节奏。想要慢动作或延时摄影就明说;实时是无声的默认值。
用结构搭建提示词
不必从零写自由文本,可以从结构化选项里挑选。AI视频提示词生成器覆盖 11 个类别——景别、镜头角度与运动、动作节奏、时间天气、光线、调色、风格、情绪、特效、构图——每个选项都带参考图,把每类别的单选组装成一条针对目标模型调优的完整提示词。全程在浏览器内运行:你写的任何内容都不会被上传。