AI短片制作:从剧本到分镜的提示词设计与完整工作流

📅 2026/7/29 9:14:47
AI短片制作:从剧本到分镜的提示词设计与完整工作流
最近有不少朋友在后台问我说看到别人用 AI 直接生成短片、短剧从剧本到分镜再到成片一条龙搞定看起来很酷但自己试了试要么卡在剧本生成上要么分镜脚本写出来不像那么回事要么最后成片的效果和想象中差太远。其实这类“全流程 AI 短片制作”的核心并不在于你用了多厉害的模型或者有多少高级参数可以调而在于你能不能把“剧本生成”和“分镜设计”这两个环节的提示词Prompt写成一套可复用、可组合的“技能”Skill。一旦你把这两个技能固化下来后面再换题材、换风格只需要微调几个关键词就能快速跑通从 0 到 1 的完整流程。今天我就以 Codex 为例结合我最近几次实战的经验把“剧本生成 Skill”和“分镜脚本 Skill”的提示词设计思路、组合使用方法以及从文本到成片的完整操作路径一步一步拆解清楚。1. 先搞清楚 Codex 在 AI 短片流程中真正解决的是什么问题很多人一听到“用 Codex 做 AI 短片”第一反应是“它是不是一个视频生成模型”——不是。Codex 本身是一个基于代码生成和文本理解的模型它不直接生成视频。那为什么我们还要用它来做短片Codex 在这个流程里的核心价值是帮你把“创意”结构化地翻译成“可执行的制作指令”。举个例子你想拍一个 30 秒的悬疑短剧脑子里可能有一个模糊的念头“开头是一个雨夜一个女人收到神秘短信然后她看向窗外发现有人影。”这个念头很好但如果直接丢给视频生成模型大概率会得到一堆风格不统一、镜头逻辑混乱的画面。Codex 能做的是帮你把这个念头扩展成一个完整剧本包含角色设定、对话、场景描述、情绪节奏。一个分镜脚本把剧本里的每一句话拆解成具体的镜头类型远景、中景、特写、画面内容、镜头运动、时长建议。这两个输出才是视频生成模型能直接使用的“高质量输入”。而 Codex 的优势在于它擅长理解结构化指令能根据你的初始想法生成符合影视工业标准的中间产物。所以不要指望 Codex 直接吐视频它的定位是“创意翻译器”和“制作规划器”。理解了这一点后面设计提示词时就不会跑偏。2. 剧本生成 Skill不只是生成文字而是生成“可拍摄”的剧本如果你让 Codex 写一个“悬疑短剧剧本”它可能会给你一段文学性很强的文字但里面可能缺少场景划分、角色动作指示、时长控制——这些才是实际拍摄时最需要的信息。2.1 剧本提示词的核心结构一个能直接用于后续分镜生成的剧本提示词应该包含以下几个部分你是一个专业的短剧编剧。请根据以下要求生成一个时长约30秒的短剧剧本。 主题[用户输入的主题例如“雨夜悬疑”] 风格[例如“悬疑”、“喜剧”、“温情”] 角色[主要角色简介例如“一个独自在家的女人”] 关键情节[用户提供的关键情节点例如“收到神秘短信”、“发现窗外有人影”] 输出要求 1. 剧本必须包含场景描述、角色动作、简单对话如果有。 2. 每一部分标注预计时长秒。 3. 总时长严格控制在25-35秒之间。 4. 语言简洁避免文学性描述聚焦可视觉化的内容。这个结构的关键在于有时长约束短视频平台的节奏快30秒内必须完成起承转合。可视觉化避免“她感到一阵恐惧”这样的内心描述改成“她瞳孔放大后退一步”。场景分明每个场景独立成段方便后续拆解分镜。2.2 剧本生成的常见坑点与优化第一次跑剧本生成最容易遇到两个问题一是剧本太长或太短。Codex 对“30秒”没有直观感受容易生成 2 分钟的剧本或 10 秒的片段。解决方法是在提示词里明确写上“总时长严格控制在25-35秒之间”并且在生成后自己读一遍估算时间。如果超了就手动删减过渡性描述。二是对话太多动作太少。AI 容易写成对话剧但短视频更依赖画面。可以在提示词里强调“动作描述占比应高于对话”或者直接要求“对话不超过3句”。举个例子这是优化前后的对比优化前“她觉得很害怕于是打电话给朋友。”优化后“她快速拿起手机手指颤抖地拨号镜头特写她的额头冷汗。”后者直接给了分镜线索手机特写、额头特写。这就是“可拍摄”的剧本。3. 分镜脚本 Skill把文字剧本转译成镜头语言有了剧本下一步是把它变成分镜。分镜脚本是连接剧本和成片的关键桥梁也是最容易被新手忽略的环节。3.1 分镜提示词的设计逻辑分镜提示词的核心任务是让 Codex 理解“镜头语言”。你需要告诉它常见的镜头类型、运动方式、时长分配规则。一个实用的分镜提示词模板你是一名资深的分镜师。请将以下剧本转化为分镜脚本。 剧本[上面生成的完整剧本] 输出要求 1. 按场景顺序列出每一个镜头。 2. 每个镜头包含 - 镜头编号 - 镜头类型远景/全景/中景/近景/特写 - 画面内容基于剧本描述 - 镜头运动固定/推/拉/摇/移 - 时长秒 3. 总镜头数控制在8-12个之间。 4. 注意节奏开头用全景建立场景关键情节用特写强调结尾镜头留有悬念。这个模板里最关键是第2点和第4点镜头类型和运动这是分镜的专业要素Codex 能理解这些术语并合理分配。节奏建议告诉 Codex“开头建立场景-中间强调关键-结尾留悬念”它就会按这个逻辑编排镜头。3.2 分镜输出的检查与调整Codex 生成的分镜脚本一般需要人工微调。重点检查镜头时长总和是否匹配剧本总时长如果剧本30秒分镜总时长只有20秒说明有些镜头分配时间太短要加长静态镜头或慢动作。镜头类型是否太单一如果全是中景画面会单调。手动插入几个特写或远景增加层次感。运动镜头是否合理推拉摇移不能滥用一般一个30秒短片2-3个运动镜头就够了太多会显得晃。分镜脚本的本质是视频的“施工图”。图越清晰后面视频生成越顺利。4. 从分镜到成片选择适合的视频生成工具Codex 负责产出剧本和分镜但成片还需要视频生成工具。目前市面上有几类选择各有适用场景。4.1 工具选型考量工具类型代表工具优点缺点适合场景文生视频如 Stable Video Diffusion、Pika直接输入文本生成视频操作简单对复杂脚本支持弱画面连续性一般概念验证、简单动态海报图生视频如 Runway、Gen-2可以对单张图做动态化控制性强需要先有高质量图片成本高镜头级精雕细琢组合工具如剪映AI生成素材灵活可分镜头生成再拼接工作流复杂需要剪辑能力追求成片质量不怕麻烦对于刚入门的朋友我更建议先用“文生视频”工具做最小可行性验证。因为它的输入直接是分镜脚本里的“画面内容”不需要你额外准备图片。4.2 分镜到视频的转换技巧不是所有分镜描述都适合直接丢给视频生成模型。你需要做一次“翻译”分镜描述“镜头3特写女人手指颤抖地拨号额头有冷汗。”视频生成输入“特写镜头一个女人的手指在手机上颤抖地拨号额头有冷汗电影感悬疑氛围。”翻译的原则是明确镜头类型写上“特写镜头”帮助模型理解构图。补充氛围词加上“电影感”、“悬疑氛围”引导风格。简化复杂动作如果描述里有“她转身然后跑开”最好拆成两个镜头因为视频模型对连续复杂动作的处理能力还有限。一次只生成一个镜头最后用剪辑软件拼接。不要试图让模型一次性生成30秒完整视频——现在的技术还做不到高质量的长视频生成。5. 完整工作流演示从0到1做一个30秒悬疑短片理论说了这么多我们来跑一个完整流程。5.1 步骤一生成剧本提示词你是一个专业的短剧编剧。请根据以下要求生成一个时长约30秒的短剧剧本。 主题雨夜悬疑 风格悬疑 角色一个独自在家的女人 关键情节收到神秘短信、发现窗外有人影 输出要求 1. 剧本必须包含场景描述、角色动作、简单对话如果有。 2. 每一部分标注预计时长秒。 3. 总时长严格控制在25-35秒之间。 4. 语言简洁避免文学性描述聚焦可视觉化的内容。Codex 输出示例场景1客厅夜晚雨声5秒 - 女人独自坐在沙发上手机突然亮起显示一条未知号码的短信“我知道你在家。”3秒 - 她皱眉犹豫后点开短信表情紧张。2秒 场景2窗户边10秒 - 她走到窗边拉开窗帘一角向外看。4秒 - 窗外雨很大远处路灯下似乎有人影闪过。3秒 - 她瞳孔放大快速拉上窗帘背靠墙壁喘息。3秒 场景3门厅10秒 - 她悄悄走到门边透过猫眼向外看。4秒 - 猫眼外一片模糊只有雨声。3秒 - 突然敲门声响起她吓得后退。3秒总时长约25秒预留5秒给镜头过渡。5.2 步骤二生成分镜脚本提示词你是一名资深的分镜师。请将以下剧本转化为分镜脚本。 剧本[上面的完整剧本] 输出要求 1. 按场景顺序列出每一个镜头。 2. 每个镜头包含 - 镜头编号 - 镜头类型远景/全景/中景/近景/特写 - 画面内容基于剧本描述 - 镜头运动固定/推/拉/摇/移 - 时长秒 3. 总镜头数控制在8-12个之间。 4. 注意节奏开头用全景建立场景关键情节用特写强调结尾镜头留有悬念。Codex 输出示例镜头1全景固定客厅全景女人坐在沙发上窗外雨夜5秒 镜头2特写固定手机屏幕亮起显示短信内容3秒 镜头3中景固定女人皱眉看手机的表情2秒 镜头4中景移女人从沙发走到窗边4秒 镜头5特写固定她的手拉开窗帘一角3秒 镜头6全景摇窗外雨景路灯下人影闪过3秒 镜头7特写推她瞳孔放大的表情3秒 镜头8中景固定她背靠墙喘息3秒 镜头9近景移她走到门边4秒 镜头10特写固定猫眼外的模糊雨景3秒 镜头11特写固定她突然惊吓的表情画外敲门声3秒5.3 步骤三分镜头生成视频现在把每个镜头的“画面内容”提取出来分别输入视频生成工具“全景镜头夜晚客厅一个女人坐在沙发上窗外下雨电影感悬疑氛围”“特写镜头手机屏幕亮起显示一条神秘短信恐怖氛围”...依次处理每个镜头生成时要注意每个镜头单独生成保存为视频片段。使用相同的画风参数如“电影感”、“悬疑氛围”保持视觉统一。时长设置与分镜脚本一致。5.4 步骤四剪辑合成把所有视频片段导入剪辑软件如剪映、Premiere按顺序拼接加上雨声音效、紧张背景音乐调整转场效果。关键检查点镜头之间的衔接是否自然。总时长是否控制在30秒左右。音效和画面节奏是否匹配。6. 常见问题排查与优化建议即使按照流程走第一次尝试也可能遇到各种问题。这里总结几个常见坑点和解决方案。6.1 剧本问题排查问题1剧本节奏太快或太慢排查读一遍剧本估算每个动作的合理时间。正常人走到窗边需要3-4秒而不是1秒。解决在提示词中明确要求“每个动作给出合理时长估计”或者生成后手动调整。问题2剧本不可视化排查检查是否有“她想了很多”这类内心描述。解决在提示词中加入“所有描述必须是可见的动作或表情”。6.2 分镜问题排查问题1镜头类型单一排查看分镜脚本中是否全是“中景固定”。解决在提示词中要求“至少包含3种不同的镜头类型”。问题2镜头运动不合理排查检查是否有不必要的“推拉摇移”。解决手动修改为“固定”镜头除非确实需要运动效果。6.3 视频生成问题排查问题1画面风格不统一排查不同镜头生成的画风差异大。解决在每个镜头的提示词中都加入相同的风格词如“电影感悬疑风格”。问题2动作不符合预期排查生成的视频中人物动作与描述不符。解决简化动作描述避免复杂连续动作或者拆分成更简单的镜头。7. 进阶技巧如何让 AI 短片更有“人味”技术流程跑通后下一个挑战是如何让AI生成的短片不那么“机械”。这需要一些进阶技巧。7.1 角色情绪曲线设计好的短片有情绪起伏。你可以在剧本生成阶段就设计好情绪曲线在剧本开头注明情绪节奏 - 0-10秒平静中带一丝不安 - 10-20秒紧张感逐步上升 - 20-30秒恐惧爆发Codex 会根据这个曲线调整剧本中的动作和描述强度。7.2 视觉隐喻的使用在分镜阶段加入视觉隐喻能提升短片的艺术性。比如“窗外人影闪过”可以改成“窗外树枝像人手一样晃动”增加心理恐怖感。“她害怕”可以表现为“水滴声逐渐变成心跳声”。这些隐喻需要在分镜提示词中明确写出因为AI不会自动添加象征性元素。7.3 声音设计提示虽然Codex不生成声音但你可以在分镜脚本中加入声音提示每个镜头补充声音描述 - 镜头1雨声背景音 - 镜头2手机震动声 - 镜头11突然的敲门声这样在剪辑阶段你就有了明确的声音设计指南。8. 长期使用建议从单次项目到可复用流程如果你打算长期用这套方法制作AI短片建议建立自己的技能库8.1 创建个人Skill库把验证过的提示词保存为模板剧本生成_悬疑.json分镜生成_30秒快节奏.json剧本生成_温情.json分镜生成_慢节奏.json下次制作时直接调用对应模板只需修改主题和关键情节。8.2 建立效果评估体系每个项目完成后记录哪些提示词效果好哪些镜头生成质量差总耗时多少成品与预期的差距积累一段时间后你就知道什么类型的短片适合用这个方法什么题材需要调整策略。8.3 保持技术更新AI视频生成技术发展很快每个月都有新工具和新方法出现。定期关注新的视频生成模型质量、速度、成本新的提示词技巧新的工作流优化方案但核心思路不变好的输入决定好的输出。无论工具怎么变扎实的剧本和分镜设计永远是高质量短片的基础。这套方法最大的价值不是让你一次就做出完美短片而是提供了一个可迭代的框架。第一次可能只有60分但每次优化提示词、调整工作流分数就会逐步提高。最重要的是你开始用结构化的思维对待创意表达这才是无论技术如何变迁都能持续受益的能力。