文生视频这件事我从2023年底开始密集折腾从最早的Runway Gen-2、Pika到后来的可灵、MiniMax海螺再到本地跑ComfyUI配AnimateDiff和SVD踩过的坑比生成的视频还多。最深的感受是同一个模型不同人写提示词出片质量能差出三四个档次。很多人以为提示词就是“描述画面”写一句“一个女孩在雨中奔跑”就完事了结果生成出来要么人物扭曲要么镜头乱晃要么风格完全跑偏。问题不在模型在于提示词的结构和颗粒度没到位。这篇内容我想把文生视频提示词这件事彻底讲透。不管你是用MiniMax、可灵这类在线API还是在ComfyUI里跑本地工作流或者用Runway做快速原型提示词的底层逻辑是相通的。我会从“为什么大多数人的提示词是废的”讲起然后给出一个可以直接套用的结构化框架再针对不同平台做适配拆解最后聊几个实测中反复验证过的技巧和坑。适合已经上手过至少一个视频生成工具、但出片质量不稳定的朋友也适合刚接触想少走弯路的新手。1. 为什么你写的提示词生成出来总是不对味1.1 视频提示词和图像提示词的本质差异很多人从Midjourney、Stable Diffusion转过来做视频习惯性地把图像提示词那套直接搬过来结果发现完全不是一回事。图像提示词的核心是“静态构图”——你描述的是某一帧的画面内容、风格、光影、材质。但视频多了一个致命维度时间。模型不仅要理解画面里有什么还要理解这些东西在时间轴上怎么变化、镜头怎么运动、主体怎么动作。我举个具体的例子。图像提示词写“一个穿红色连衣裙的女人站在海边黄昏光线电影感”Midjourney能给你出一张很不错的图。但同样的描述丢给可灵或MiniMax生成出来的视频大概率是女人站着不动海浪微微起伏然后镜头缓慢推近——看起来“对”但毫无叙事感像一张会动的照片。问题出在哪儿你没有告诉模型“这5秒内发生了什么”。视频提示词必须包含动作指令和镜头指令。动作指令描述主体在时间轴上的变化比如“女人缓缓转身裙摆被海风吹起”。镜头指令描述摄影机怎么运动比如“镜头从远景缓慢推近到中景”。这两样东西缺一个生成出来的视频就会显得“呆”。还有一个容易被忽略的点视频模型对提示词的长度容忍度比图像模型低得多。图像模型你写200个token它也能消化但视频模型因为要处理时间维度注意力机制的计算量暴增过长的提示词反而会导致关键信息被稀释。实测下来MiniMax和可灵这类在线模型80到120个中文字符是比较舒服的区间超过150字就开始出现“顾此失彼”的情况——你写了五个动作它只执行了前两个。1.2 模型到底在“听”什么注意力权重的分配逻辑要写好提示词得先理解模型是怎么“读”你的话的。文生视频模型本质上是一个条件扩散模型你的提示词经过文本编码器通常是CLIP或T5的变体转成嵌入向量然后在扩散过程中通过交叉注意力机制影响每一帧的生成。关键来了注意力权重不是均匀分配的。模型对提示词里不同位置的词关注度是不一样的。通常来说开头的词权重最高结尾的词次之中间的最容易被忽略。这跟人类阅读习惯有关训练数据里的文本描述也遵循这个分布。所以如果你把最重要的信息放在提示词中间模型很可能没“看见”。我做过一组对比测试用MiniMax生成“一只橘猫从桌子上跳下来慢动作特写镜头暖色调背景是虚化的书架”。第一版把“慢动作”放在中间生成出来是正常速度。第二版把“慢动作”提到开头“慢动作一只橘猫从桌子上跳下来特写镜头暖色调背景是虚化的书架”慢动作效果就出来了。这不是玄学是注意力机制的实际表现。另外具体名词的权重高于抽象形容词。“电影感”这种词模型其实不太知道具体指什么它可能给你加个黑边、调个色调就完事了。但“35mm胶片颗粒”“浅景深”“低角度仰拍”这种具体的技术术语模型在训练数据里见过大量对应样本执行起来准确得多。1.3 那些“看起来对但就是不对”的提示词长什么样我收集了几十个新手常写的提示词总结出三类典型问题。第一类是形容词堆砌型“美丽的、梦幻的、唯美的、震撼的、史诗级的画面”。这种提示词的问题在于形容词之间互相冲突且没有具体指向。模型面对一堆抽象赞美词只能随机选一个方向发挥结果就是“开盲盒”。第二类是叙事型“一个男孩从小镇出发历经千辛万苦最终成为英雄”。这是小说梗概不是视频提示词。视频模型只能生成几秒到十几秒的片段你给它一个跨越多年的叙事它只能随机截取一个模糊场景。第三类是矛盾型“静止的镜头中人物快速奔跑同时画面缓慢旋转”。静止和旋转矛盾快速和缓慢矛盾模型会陷入混乱生成出来的东西要么卡顿要么扭曲。提示写提示词之前先问自己一句——如果我只给你5秒钟和一台摄影机你能拍出我描述的东西吗如果答案是否定的说明提示词需要拆解或简化。2. 一套可复用的结构化提示词框架2.1 五段式结构主体、动作、镜头、风格、约束经过大量实测我固定下来一套五段式结构适配绝大多数文生视频模型。这五段分别是主体描述、动作指令、镜头语言、视觉风格、技术约束。顺序很重要按这个顺序写模型的理解准确率明显更高。主体描述放在最前面因为这是模型最先需要确定的内容。格式建议是“主体特征环境”比如“一个穿黑色风衣的中年男人站在雨夜的霓虹街头”。注意特征要具体但不要超过三个多了会分散注意力。动作指令紧接主体描述时间轴上的变化。这里有个技巧用“起始状态→过程→结束状态”的方式写。比如“他缓缓抬起头雨水顺着脸颊滑落然后转身走向画面深处”。这样模型能理解动作的完整弧线而不是一个孤立的姿势。镜头语言单独成句用标准摄影术语。常用的有推镜dolly in、拉镜dolly out、摇镜pan、跟拍tracking shot、升降crane shot、手持handheld。景别也要指定远景、全景、中景、近景、特写。比如“中景跟拍镜头轻微手持晃动”。视觉风格决定整体调性。这里建议用参考锚点而不是抽象词。不要说“电影感”说“类似《银翼杀手2049》的橙青色调高对比度霓虹光晕”。模型对具体作品的风格迁移能力比抽象词强得多。技术约束放在最后包括帧率、时长、分辨率、宽高比这些。不过大部分在线平台这些是单独设置的提示词里写不写影响不大。但在ComfyUI里跑本地工作流时这些参数需要在节点里配提示词里可以省略。2.2 动作描述的颗粒度控制写到什么程度刚刚好动作描述是最容易写过头的地方。写太少模型不动写太多模型乱动。我的经验是一个5秒的视频写1到2个连续动作就够了。10秒的视频可以写到3个动作但动作之间必须有逻辑连贯性。什么叫“连续动作”比如“拿起杯子喝了一口水”是一个连续动作包含“伸手→拿杯→举到嘴边→喝→放下”这一串。你不需要把每一步都写出来模型能理解“喝了一口水”这个复合动作。但如果你写“拿起杯子然后走到窗边然后打开窗户然后看向远方”这就是四个独立动作5秒内根本做不完模型会强行压缩导致动作变形。颗粒度控制的另一个维度是动作速度。中文里“缓缓”“快速”“猛地”这些副词对模型是有影响的但影响有限。更可靠的方式是用镜头语言来暗示速度比如“慢动作”配合“升格镜头”模型对这两个词的响应比单纯写“缓缓”要强。我实测下来MiniMax对动作描述的响应比较灵敏写“缓缓转头”和“快速转头”能看出明显区别。可灵相对保守一些动作幅度偏小需要写得更明确比如“大幅度转头头发甩动”。Runway Gen-3对动作的理解最好但有时候会“过度发挥”你写“走”它给你来个奔跑。2.3 镜头语言的写法让模型理解“谁在看”和“怎么看”镜头语言是区分“会写”和“不会写”的分水岭。大部分人只写画面内容不写镜头结果就是模型默认给一个固定机位的中景看起来像监控录像。镜头语言要解决三个问题机位在哪儿、镜头怎么动、景别是什么。机位描述视角常用的是平视、俯视、仰视、航拍、第一人称视角POV。比如“低角度仰拍”能让主体显得高大“俯视航拍”适合展示环境全貌。镜头运动描述摄影机的轨迹。推拉摇移跟升降这六个字是基础。进阶一点可以写“环绕拍摄”“希区柯克变焦”“斯坦尼康稳定跟拍”。注意镜头运动和主体动作要协调。如果主体在向前跑镜头写“推镜”就会撞上写“跟拍”才对。景别决定观众看到多少信息。远景交代环境全景展示全身中景是对话常用近景突出表情特写强调细节。一个视频里景别可以变化比如“从远景推至中景”这种写法模型是能理解的。注意不是所有模型都支持复杂的镜头运动。MiniMax和可灵对“推拉摇移”支持较好但“希区柯克变焦”这种就需要模型有对应的训练数据。Runway Gen-3的镜头理解最强基本写什么给什么。ComfyUI里用AnimateDiff的话镜头运动需要通过运动LoRA或控制节点来实现光靠提示词效果有限。3. 主流平台适配同一套框架的不同写法3.1 MiniMax海螺中文提示词的甜区与雷区MiniMax海螺是国内文生视频里对中文提示词支持最好的之一但它的“脾气”也很明显。我用了大概三个月生成过几百条视频总结出几个关键点。甜区MiniMax对具象的中文描述响应极好。你写“一个穿汉服的女孩在竹林里弹古筝阳光透过竹叶洒下来镜头缓慢环绕”它能给你生成相当有韵味的画面。它对“国风”“古风”这类文化标签的理解也到位不需要额外解释。雷区MiniMax对抽象情绪词几乎无感。你写“孤独感”“压抑的氛围”它不知道该怎么表现。必须转化成具体的视觉元素比如“空旷的房间里只有一盏台灯人物蜷缩在角落冷色调”。另一个雷区是多主体交互。你写“两个人打架”它大概率生成两个模糊的人影在互相推搡。必须写清楚“一个穿黑衣的男人挥拳打向穿白衣的男人白衣男人侧身闪避”。主体特征要区分开动作要具体到肢体。关于提示词长度MiniMax海螺实测60到100个中文字符效果最稳。太短信息不足太长注意力分散。另外MiniMax对镜头术语的响应比想象中好“推镜”“拉镜”“环绕”都能识别但“手持晃动”这种它理解得不太稳定有时候会生成画面抖动过度的废片。还有一个细节MiniMax的首帧控制功能很实用。如果你有参考图可以用图生视频模式提示词重点写动作和镜头主体描述可以简化。实测下来图生视频的提示词控制在50字以内效果最好因为画面信息已经由参考图提供了。3.2 可灵写实风格的提示词策略可灵Kling的强项是写实风格和物理模拟。它生成的人物动作比较自然物体运动符合物理规律不像有些模型会出现“穿模”或“反重力”的诡异画面。但可灵的提示词需要更“克制”。核心策略少写风格多写动作和镜头。可灵默认的写实风格已经很好你不需要写“电影感”“写实风格”这些词写了反而可能让它往奇怪的方向调。把提示词集中在“谁在做什么”和“镜头怎么拍”上。可灵对动作幅度比较敏感。写“走”它就走写“跑”它就跑写“狂奔”它会跑得很快但可能变形。建议动作描述用中等强度的词“快步走”“小跑”比“狂奔”“冲刺”更稳。可灵的镜头语言支持也不错但“环绕”和“跟拍”有时候会混淆。如果要环绕写“镜头围绕主体旋转”如果要跟拍写“镜头跟随主体移动”。用更直白的描述替代专业术语可灵反而理解得更准。时长方面可灵默认5秒可以延长到10秒。10秒的视频提示词可以写两个动作段落但中间要用“然后”“接着”明确过渡。实测下来可灵对“然后”这个词的响应是有效的能理解时间上的先后关系。3.3 Runway Gen-3英文提示词的精确控制Runway Gen-3是目前对提示词理解最精确的模型之一但它的最佳实践是用英文写。虽然它也支持中文但英文提示词的出片质量明显更高因为它的训练数据以英文为主。英文提示词的结构和中文类似但有几个差异。第一Runway对摄影术语的响应极其准确。“dolly in”“pan left”“tracking shot”这些词写进去基本能精确执行。第二Runway支持更长的提示词150到200个英文单词都能消化但关键信息还是要放前面。第三Runway对风格参考的响应很好你可以写“in the style of Wes Anderson”或者“shot on 16mm film”它能给出很接近的调性。一个Runway特有的技巧是用“camera”开头的句子来强调镜头。比如“Camera slowly pushes in on a woman standing by the window, rain streaming down the glass”。把camera放在句首模型对镜头运动的执行优先级会提高。Runway的雷区是过度复杂的场景。如果你写一个包含五个以上主体的场景它会出现“主体融合”或“主体消失”的问题。建议一个镜头里主体不超过三个且要有明确的主次关系。3.4 ComfyUI本地工作流提示词之外的变量在ComfyUI里跑文生视频提示词只是众多变量之一。你还需要考虑模型选择、采样器、步数、CFG scale、运动模块强度等等。这里不展开工作流搭建只讲提示词在ComfyUI环境下的特殊之处。ComfyUI里常用的视频生成方案有AnimateDiff、SVDStable Video Diffusion、以及各种基于SDXL的时序模型。AnimateDiff对提示词的依赖度最高因为它本质上是在SD的基础上加了运动模块提示词既要描述画面又要描述运动。写法和在线平台类似但需要额外在提示词里加入运动相关的词比如“motion”“moving”“animated”。SVD对提示词的依赖度很低它主要靠参考图驱动提示词的影响有限。用SVD的话提示词写个大概就行重点放在参考图的质量上。ComfyUI里有一个在线平台没有的优势你可以用负面提示词。在线平台通常不开放负面提示词但ComfyUI里可以写。常用的负面提示词包括“blurry, distorted, extra limbs, bad anatomy, flickering, jitter”。这些词能显著提升出片稳定性。还有一个ComfyUI特有的技巧用提示词调度prompt scheduling。你可以在不同的采样步数区间使用不同的提示词比如前20步用“a cat sitting”后20步用“a cat running”。这样能实现动作的变化。不过这个技巧需要工作流支持新手可以先跳过。提示ComfyUI里如果遇到爆内存的问题优先降低分辨率或帧数而不是改提示词。提示词对显存占用的影响很小分辨率和帧数才是大头。4. 实测有效的提示词技巧与避坑清单4.1 用“参考锚点”替代抽象形容词这是我认为最有效的单条技巧。抽象形容词的问题在于每个人对“唯美”“震撼”的理解不一样模型的理解也不一样。但如果你给一个具体的参考锚点模型就能找到对应的视觉特征。参考锚点可以是电影、导演、摄影师、艺术风格、胶片型号。比如不要写“电影感”写“类似《布达佩斯大饭店》的对称构图和粉彩色调”不要写“复古”写“70年代柯达胶片质感暖黄色调轻微颗粒”不要写“赛博朋克”写“《银翼杀手》风格的霓虹雨夜高对比度蓝紫主色调”实测下来MiniMax和Runway对参考锚点的响应最好可灵次之。ComfyUI里如果用了风格LoRA参考锚点的效果会被LoRA覆盖这时候提示词里的风格描述可以简化。4.2 动作描述的“起始-过程-结束”写法前面提过这个结构这里展开讲具体怎么写。假设你要生成“一个人从椅子上站起来走到窗边”这个动作。起始状态他坐在椅子上双手放在扶手上。过程他推开椅子站起来转身面向窗户。结束状态他走到窗边停下脚步望向窗外。提示词可以写成“一个男人坐在椅子上然后推开椅子站起来转身走向窗户最后停在窗边望向窗外”。注意用了“然后”“最后”来标记时间顺序。实测这个写法在可灵和MiniMax上都能得到比较连贯的动作。如果只写“一个人从椅子上站起来走到窗边”模型可能会生成“站起来”和“走到窗边”两个割裂的动作中间缺少过渡。加上过程描述后动作的流畅度明显提升。4.3 镜头与动作的协调避免“撞车”和“打架”镜头运动和主体动作如果不协调会出现两种问题撞车和打架。撞车是指镜头运动方向和主体运动方向冲突。比如主体向前走镜头写“推镜”向前推两者会撞在一起画面会变得很挤。正确写法是主体向前走镜头写“跟拍”或“拉镜”。打架是指镜头运动和主体动作争夺注意力。比如主体在做一个复杂的手部动作镜头同时在快速环绕观众的眼睛不知道该看哪里。这种情况下要么简化动作要么简化镜头只保留一个重点。我的经验法则是一个镜头里镜头运动和主体动作只能有一个是“复杂”的。如果主体动作复杂比如打斗、舞蹈镜头就写“固定机位”或“缓慢推镜”。如果镜头运动复杂比如环绕、升降主体动作就写“站立”“行走”这种简单的。4.4 那些我踩过的坑从“鹈鹕骑自行车”说起“鹈鹕骑自行车”这个提示词在圈子里流传很广被用来测试模型的物理理解和创意生成能力。我拿它测过MiniMax、可灵和Runway结果很有意思。MiniMax生成的是一只鹈鹕站在自行车旁边偶尔扑腾翅膀。它理解了“鹈鹕”和“自行车”但没理解“骑”这个动作。后来我把提示词改成“一只鹈鹕坐在自行车座垫上翅膀扶着车把双脚踩在踏板上”才生成出接近“骑”的画面。可灵生成的是一只鹈鹕在自行车上方飞自行车自己在走。它把“骑”理解成了“伴随”。改成“鹈鹕的身体接触自行车座垫翅膀握住车把”之后效果好了一些但鹈鹕的翅膀结构还是不太对。Runway生成的最接近一只鹈鹕骑在自行车上但腿的位置有点奇怪。Runway对“骑”这个动作的理解最好但生物结构上还是有瑕疵。这个测试给我的教训是模型对“非典型动作”的理解需要更具体的肢体描述。你不能指望模型自己脑补“鹈鹕怎么骑自行车”必须把关键接触点写出来——翅膀在哪、脚在哪、身体和车座的关系。另一个坑是多动作冲突。我曾经写“一个人边跑边打电话边看手表”生成出来的人物手部完全扭曲。后来拆成三个镜头分别生成再剪辑到一起效果好得多。视频模型目前还不擅长处理同一主体同时做多个不相关动作。4.5 提示词长度与信息密度的平衡最后聊一下长度问题。我统计过自己生成效果最好的那些视频提示词长度分布如下平台最佳长度区间中文字符超过后的典型问题MiniMax海螺60-100动作遗漏、主体模糊可灵50-90风格漂移、动作变形Runway Gen-3100-180英文词主体融合、镜头混乱ComfyUIAnimateDiff40-80画面崩坏、运动异常这个表不是绝对的但可以作为起点。核心原则是信息密度比长度重要。与其写200个字塞满细节不如写80个字把最关键的主体、动作、镜头说清楚。如果你确实需要表达复杂场景我的建议是分镜生成。把复杂场景拆成多个5秒片段每个片段用独立的提示词生成最后剪辑到一起。这样每个片段的提示词都能保持在最佳长度区间出片质量更稳定。5. 从提示词到成片的完整工作流建议5.1 先写分镜再写提示词很多人是直接对着模型写提示词的想到什么写什么。我的建议是先用文字写一个简单的分镜脚本哪怕只有三行。分镜脚本解决的是“叙事逻辑”问题提示词解决的是“视觉执行”问题。这两个问题分开处理效率高得多。一个简单的分镜脚本格式镜头15秒中景男人坐在昏暗的房间里低头看着手机。镜头缓慢推近。镜头25秒特写手机屏幕上是一条消息。男人的手指在屏幕上悬停。镜头35秒近景男人抬起头眼神变化。镜头轻微拉远。有了这个脚本每个镜头的提示词就很好写了。而且分镜脚本能帮你发现叙事上的漏洞比如镜头之间缺少过渡、动作不连贯等等。5.2 用“种子固定微调提示词”做迭代视频生成有随机性同一个提示词跑两次结果可能不一样。如果你想优化某个镜头建议固定种子seed然后只改提示词里的一个变量。这样你能清楚地知道是哪个词导致了变化。比如第一版提示词生成的动作太快你固定种子只把“快速转头”改成“缓缓转头”对比两版结果。如果动作变慢了说明“缓缓”这个词有效。如果没变化说明这个模型对速度副词的响应不敏感需要换一种方式比如加“慢动作”或调整帧率。这个迭代方法比“每次改一堆词然后凭感觉判断”高效得多。我通常一个镜头迭代3到5版就能达到可用状态。5.3 后期补救当提示词搞不定的时候有些效果提示词确实搞不定这时候不要死磕直接上后期。比如画面抖动用后期稳定工具处理比在提示词里写“稳定画面”有效色彩不对后期调色比反复改提示词里的风格描述快动作不连贯剪辑时加速或减速或者用补帧工具时长不够生成多个片段拼接比强行延长单个片段质量好提示词是工具不是万能药。知道什么时候该用后期什么时候该改提示词是效率的关键。5.4 建立自己的提示词库最后一条建议把你生成效果好的提示词存下来。按场景分类比如“人物特写”“风景航拍”“动作场景”“产品展示”。下次遇到类似需求直接调出来改几个词就能用。我自己的提示词库已经积累了200多条覆盖了大部分常见场景。这个库的价值在于它是我实测过的、知道在哪个平台上能出什么效果的“确定性资产”。比每次从零开始写提示词效率高太多了。提示存提示词的时候顺便记下平台、种子、参数和生成效果的一句话评价。过几个月回头看这些记录比提示词本身更有价值。关于MiniMax H3的本地部署和量化版CLIP维度不匹配的问题那是另一个层面的技术话题涉及模型加载和节点配置跟提示词的关系不大。如果你在ComfyUI里遇到CLIP 5120和4096不匹配的报错优先检查文本编码器节点的配置而不是改提示词。提示词写对了但模型加载错了照样出不了片。写提示词这件事说到底是一个“翻译”工作——把你脑子里的画面翻译成模型能理解的语言。翻译得越准确出片越接近你的想象。而这个翻译能力只能靠大量实测来积累。我上面写的这些是我踩了无数坑之后总结出来的“语法规则”但具体的“词汇量”还得你自己去攒。