🧰 UtlKit

AI视频提示词撰写指南:T2V与I2V结构、镜头语言与实例

为什么提示词决定一切

文生视频(T2V)和图生视频(I2V)模型并不"理解"你的想法——它们把你的文字与训练所用的影片素材进行匹配。提示词是它们收到的唯一指令,措辞的细微差别会改变生成结果。"路上有一辆车"和"一辆红色老式汽车沿海岸公路行驶,金色时刻,跟拍镜头"会用同一个模型生成完全不同的两个片段。

本文介绍有效的写法:六段式 T2V 提示词结构、视频模型能理解的镜头语言词汇、I2V 提示词的不同之处,以及如何针对所用模型调整提示词。

T2V 与 I2V:两种模式,两种提示词

  • T2V(文生视频)——用文字写完整镜头:主体、动作、场景、镜头、光线、风格,模型自行想象一切的外观。
  • I2V(图生视频)——你提供一张固定外观的静帧图片,提示词只描述发生什么:运动与镜头运动。

这一区别很重要,因为它改变了文字的作用。T2V 中提示词就是完整的分镜稿;I2V 中它是附加在你已选图片上的一段运动说明。

六段式 T2V 提示词公式

每个有效的 T2V 提示词都按大致顺序回答六个问题:

  1. 主体——画面中是谁或什么,带具体细节(不是"一个人",而是"一位穿蜡布外套的灯塔看守人")。
  2. 动作——每个镜头一个主要动作。堆叠三个动作通常得到糊成一团的混合。
  3. 环境与时间——地点、一天中的时刻、天气。时刻比任何风格词都更决定色调。
  4. 镜头——景别(特写、全景……)、角度(平视、仰拍……)、运动(固定、横摇、推轨、手持……)。只说出其中一项,也能阻止模型瞎猜。
  5. 光线与色彩——光线形态:黄金时刻、蓝调时刻、霓虹、烛光;以及青橙、单色这类色彩方向。
  6. 风格与情绪——视觉语言(电影感、纪录片、动漫、黑色电影)和情绪基调(忧郁、紧张、欢快)。

完整实例

按上述六段组装:

"中景(腰部以上),一位穿蜡布外套的灯塔看守人沿海堤行走,下方浪涛拍打,黄昏风卷动外套,跟拍镜头跟随主体,蓝调时刻的光线与一点暖黄灯光,电影胶片质感,忧郁的氛围"

九个要素一句不缺,每一小句只做一件事,没有一句是装饰。

视频模型能理解的镜头语言

视频模型在与带镜头术语标注的影片素材上训练,因此标准化的电影术语有效。最常用的词:

  • 景别——大特写、特写、中近景、中景、中全景、全景、远景、大远景、顶视俯拍、双人镜头。
  • 角度——平视、仰拍、俯拍、鸟瞰、虫视、倾斜角度(荷兰角)、过肩、主观视角。
  • 运动——固定、横摇、俯仰摇移、推轨、拉轨、跟拍、环绕、摇臂、手持、变焦。
  • 节奏——慢动作、实时、快动作、延时摄影。点明节奏是被低估最强的杠杆之一:只加"慢动作"一词就能改变整个片段。

不必全说。一个镜头决定——"跟拍"或"手持"——往往比三个风格形容词的影响更大。

I2V 提示词怎么写

图生视频模式下,静帧图片已经承担了提示词的一半。图片固定了主体、场景、色调和大部分风格,文字只描述运动与镜头:

  • 发生什么:"海浪开始涌来,人物举起灯笼。"
  • 镜头如何运动:"缓慢推轨"、"固定机位,主体运动"、"手持跟拍"。
  • 节奏:"慢动作"或"实时"。

描述要短——通常一两句就够。如果再用文字复述图片内容,模型会把你的文字和照片混合,结果两边都不像。AI视频提示词生成器在该模式下自动加上前导语(中文模型为「延续输入画面」,其余模型为 "Following the input image"),并隐藏已由图片决定的类别(景别、镜头角度、构图)。

针对模型调整提示词

主流视频模型来自不同厂商:Kling(快手)、Seedance(字节跳动)、Hailuo(MiniMax)、Wan 2.2(阿里巴巴)、Vidu(生数科技),以及 Sora 2(OpenAI)、Veo 3(Google)、Runway Gen-4(Runway)、Luma Dream Machine(Luma AI)、Pika 2.2(Pika)。提示策略上有两个实际区别:

  • 语言。中文模型以中文为母语——对它们而言中文提示词最自然;其余模型主要用英文训练。用模型最擅长的语言写提示词。
  • 画质尾缀。每个模型都有偏好的收尾句——Kling 喜欢「电影级画质,光影细腻,细节丰富」,Pika 2.2 则是 "cinematic, vibrant, smooth motion, crisp detail"。加上正确的一句,同样的选项在每个模型上都会读起来像原生提示词。

生成器会自动处理这两点:按所选模型匹配输出语言(中文页面选择中文模型时输出中文,其余情况一律英文),并附上该模型自己的画质尾缀。

毁掉 AI 视频提示词的七个错误

  • 主体模糊。"某处有个人"会让模型自行想象主角;把画面中是谁或什么写具体。
  • 多个动作。堆叠三个动作会得到糊成一团的混合;每条片段一个动作。
  • 风格冲突。"纪录片手持"和"华丽棚拍质感"会互相抵消;只选一种视觉语言。
  • 没有镜头意图。不给景别或运动,模型只能猜;明确写出来。
  • 过度堆砌。200 字的段落会稀释每条指令;30-80 字的具体描述通常胜过长文。
  • 语言混杂。提示词保持单一语言;半翻译的提示词会让模型困惑。
  • 忽略节奏。想要慢动作或延时摄影就明说;实时是无声的默认值。

用结构搭建提示词

不必从零写自由文本,可以从结构化选项里挑选。AI视频提示词生成器覆盖 11 个类别——景别、镜头角度与运动、动作节奏、时间天气、光线、调色、风格、情绪、特效、构图——每个选项都带参考图,把每类别的单选组装成一条针对目标模型调优的完整提示词。全程在浏览器内运行:你写的任何内容都不会被上传。

相关工具

常见问题

什么是文生视频(T2V)提示词?

T2V 提示词是文生视频模型用来生成片段的完整文字描述。由于模型看不到图片,提示词必须指明主体、动作、环境、镜头(景别、角度、运动)、光线和风格——分镜稿通常包含的一切。

图生视频(I2V)提示词有何不同?

I2V 中,输入图片已经固定了外观、场景和色调。提示词只描述发生什么:运动、节奏和镜头运动。用文字复述图片内容通常会让模型偏离原图。

AI 视频提示词应包含什么?

六个部分:主体、一个主要动作、带时刻与天气的环境、镜头(景别、角度、运动)、光线与色彩、带情绪的风格。控制在 30-80 字的具体描述,使用单一语言。

AI 视频提示词应该多长?

更长并不更好。30-80 字具体、无歧义的描述是最佳区间:足以固定镜头,又短到没有细节被稀释。200 字的段落通常效果不如紧凑的短段落。

每个模型(Kling、Sora 2、Veo 3)都需要不同的提示词吗?

核心描述可以保持不变,但有两点应做调整:语言(Kling、Seedance、Hailuo、Wan、Vidu 等中文模型按中文提示词训练响应,其余模型最擅长英文)和收尾的画质句(每个模型不同)。结构化生成器会自动处理这两点。

相关文章