
用 AI 生成一个十几秒的好看画面,现在已经不算特别困难。
真正困难的是:
当一个故事需要几十个镜头、多个场景和多次生成时,怎样让人物、画风、剧情状态和情绪保持连贯;
抽卡失败后,怎样以最小的成本去修改,只解决出问题的部分,而不是把整段视频全部推倒重来。
(文章最后有附录提示词,如果嫌本文太长不想看,可以直接复制附录提示词到GPT即可立刻尝试)
这次,我们以《瑾声》为案例,尝试把一部长篇剧本转化为一支约四分半钟的 AI 叙事短片。
因为原剧本较长,不原创剧本,所以我们没有一开始就追求全篇生成,而是先选择了其中一段相对完整、能够独立呈现的内容。最终,这部分剧情被拆成20个彼此独立的视频段,再通过剪辑组成完整短片。
在这个过程中,我们逐渐整理出一套可以重复使用的制作方法。
如果只是想快速看懂整个方法,记住下面五个阶段就够了;
如果准备真正开始制作,再使用后文的完整工作流、确认节点和启动提示词。
整个流程,可以先理解成五个阶段

图注:先确定做多少,再把剧本变成可生成的导演镜头脚本,随后准备资产、批量生成,最后通过剪辑和局部返修完成成片。
这五个阶段分别是:
- 确定制作范围
- 剧本变成导演镜头脚本
- 制作并绑定视觉资产
- 试拍与 Agent 批量生成
- 剪辑、返修与成片
它们是帮助读者快速理解的“认知框架”。
真正执行时,每个阶段内部还会包含判断、确认、冻结、返修和回退。因此,文章后面还会提供一张更完整的执行工作流。
本项目使用了哪些工具?
这套方法并不依赖某一个固定软件,但需要区分四类工作:
- 剧本分析、导演规划与质量审核
- 人物和场景等视觉资产制作
- 视频生成与批量任务分发
- 剪辑、声音、字幕与最终输出
本项目的主要工具组合如下。
1. 规划端:ChatGPT Work+GPT-5.6 Sol
ChatGPT Work,也就是工作模式,负责管理较长的工作流程、读取剧本、拆解任务、记录确认结果,并在每个阶段等待人工审核。
官方将 Work 定位为可以结合目标、文件和上下文,完成文档、表格、演示文稿等可持续审阅成果的工作模式。
GPT-5.6 Sol 则用于剧本分析、导演镜头规划、连续性检查、提示词整理和生成结果的质量判断。官方将它定位为适合复杂专业工作的前沿模型。

图注:规划端使用工作模式和 GPT-5.6 Sol,负责拆解、规划、检查和阶段确认。
2. 资产端:ChatGPT 图片生成
人物设定图、服装参考图、场景参考图和关键道具图,可以直接在 ChatGPT 中生成和调整。
我的实际经验是:工作模式适合管理整个项目,但如果某一张人物图或场景图反复生成不理想,可以把已经确认的资产描述和参考图单独带到普通聊天中迭代图片。
这并不是说两种模式一定存在固定的质量差异,而是单张图片在普通聊天中往往更容易集中调整,不会被整个项目的复杂上下文干扰。
3. 生成端:即梦画布 Agent+Seedance
本项目的视频生成部分使用了即梦画布中的 Agent 模式,并采用 Seedance 2.0 Mini 进行视频生成。
这里需要区分“Agent”和“视频模型”:
- 视频模型负责真正生成某一个视频段。
- Agent 更像一个可以对话的任务助手,负责读取要求、匹配资产、分发任务和组织多段生成。
也就是说,我们可以一次把多段任务交给 Agent,但它并不是直接生成一条超长视频,而是把这些内容分配成多个彼此独立的视频生成任务。

图注:生成端使用即梦画布 Agent 模式,设置16:9画幅,并选择相应的视频生成模型。
需要说明的是,本文记录的是本项目制作时的工具状态。模型版本、单段时长、批量数量、积分价格和界面功能都可能继续变化。
因此,真正开始一个新项目之前,必须重新确认当前工具的能力边界,不能把本文中的具体数字当成永久规则。
第一阶段:先确定制作范围
很多项目并不是败在生成质量上,而是败在一开始没有决定“究竟要做多少”。
制作范围一旦没有确定,后面的镜头脚本、资产数量、生成成本和制作周期都会处于不断变化的状态。

图注:先确认项目目标、原作核心、工具能力和生成成本,再决定全篇完成、分期完成,还是选择一个相对完整的片段。
一部长篇剧本通常可以采用三种制作方式。
方式一:全篇一次完成
适合以下情况:
- 剧本本身不长
- 故事已经比较完善
- 总时长和预算可控
- 希望最终得到一部完整作品
这里的“一次完成”,指的是在同一个制作周期内完成整个剧本,并不是让视频模型一次生成一条超长视频。
如果是自己创作、已经打磨成熟的剧本,只要工具、时间和预算允许,通常可以优先考虑全篇制作。
方式二:全篇分期完成
适合以下情况:
- 故事值得完整制作
- 但一次完成的成本、时长或管理难度过高
- 可以按照章节、场景或剧情单元分期推进
这种方式并不是放弃完整作品,而是先把完整目标拆成多个制作周期。
方式三:选择一个相对完整的片段
适合以下情况:
- 原剧本非常长
- 当前项目主要用于测试方法
- 预算有限
- 原作不是自己的作品
- 只需要呈现其中一个完整的戏剧单元
《瑾声》采用的就是这种方式:从长篇剧本中选择一段相对完整的内容,最终制作成约四分半钟的叙事短片。
关键是:这个决定必须在拆镜头之前完成。
如果做到一半才发现预算不够、模型时长不够,前面已经写好的镜头、资产和提示词都会受到影响。
同时确认工具边界
确定内容范围时,还要一起确认:
- 当前模型单次最多能生成多长
- 支持哪些画幅和分辨率
- 支持首尾帧、图片参考还是全能参考
- 每次任务可以引用多少资产
- Agent 一次可以分发多少任务
- Agent 是否会自动改写提示词
- 每段生成消耗多少积分
- 需要预留多少试拍和返修成本
本项目采用的是5—15秒左右的独立视频段,但这只是当时的项目方案,不是所有模型都必须采用这个长度。
先估算成本,再决定范围
在本项目制作时,Seedance 2.0 Mini 在不打折的情况下,生成一个15秒视频段消耗130积分。
这只是本项目当时的历史成本记录,不代表现在或其他模型仍然采用同样的价格。
可以先用下面的方式做粗略预算:
- 基础生成成本=预计视频段数量×单段积分
项目预算=基础生成成本+试拍成本+返修预留
如果预计生成20段,就不能只准备20段的积分,还要为高风险片段试拍、失败重生和局部补拍留出空间。
第一阶段最终需要确认的,不是一句模糊的“我要做一支视频”,而是一张明确的范围说明:
- 做全篇、分期还是节选
- 目标成片时长
- 目标平台和画幅
- 视觉风格
- 声音和台词方案
- 使用的模型与工具
- 大致视频段数量
- 成本与返修余量
第二阶段:把剧本变成导演镜头脚本
原始剧本不能直接等同于视频生成提示词。
剧本主要描述人物、事件、台词和情绪;视频模型需要知道的则是:
- 当前画面里有什么
- 人物从什么状态开始
- 人物做了什么动作
- 摄影机怎样观察
- 镜头什么时候切换
- 这一段最终停在什么状态
因此,我们需要先把剧本转化成导演镜头脚本。

图注:先把故事拆成独立视频段,再继续拆成具体镜头;为每个镜头分配时长,并检查动作、台词、情绪和剪辑连续性。
先区分“视频段”和“镜头”
这两个概念不能混在一起。
视频段
一个视频段,对应一次独立的视频生成任务。
例如第1段、第2段、第3段,分别由视频模型单独生成。
镜头
镜头是一个视频段内部的画面单位。
例如一个15秒视频段内部,可以包含:
- 镜头一:人物走进房间
- 镜头二:切到另一个人物的反应
- 镜头三:两人对话
- 镜头四:特写某个关键道具
因此,一次视频生成不一定只有一个镜头。
为什么每个视频段内部还要继续拆镜头?
主要有三个原因。
第一,控制节奏
如果只告诉模型“生成一段15秒的两人对话”,模型很可能自行决定景别、节奏和动作,结果未必符合叙事需要。
拆成镜头一、镜头二、镜头三以后,画面重点和时间分配会更加明确。
第二,让不同视频段通过剪辑自然连接
传统的连续生成方式,经常会把上一段结尾作为下一段首帧,以此约束人物位置和画面连续性。
这种方法适合:
- 一镜到底
- 连续运动
- 精确的镜头延续
- 必须保持同一动作轨迹的场面
但长篇叙事通常包含大量镜头切换,并不需要每一段都严格首尾相接。
本项目采用的是另一种思路:
- 每个视频段独立生成,不使用上一段结尾作为下一段首帧;视频段之间依靠正常的镜头切换和状态连续性完成衔接。
我们放弃的是严格的“帧级连续”,但仍然保留:
- 人物身份连续
- 服装连续
- 场景和时间连续
- 道具状态连续
- 动作结果连续
- 情绪连续
- 视线和轴线连续
- 光线与整体风格连续
这样既减少了首尾帧接力带来的僵硬,也更接近传统影视剪辑的工作方式。
第三,为后期返修留下最小修改单位
如果一个15秒视频段里有四个镜头,其中只有第三个镜头出现问题,我们可以:
- 删除第三个镜头
- 缩短第三个镜头
- 用其他素材替换
- 只补拍一个新镜头
不一定要把整段15秒视频全部重新生成。
这也是为什么镜头拆分不仅服务于生成,还直接决定后期返工成本。
按什么规则拆分视频段?
可以综合考虑以下因素:
- 场景是否发生变化
- 时间是否发生变化
- 人物动作是否形成一个完整单位
- 情绪是否完成一次转折
- 台词是否能在限定时长内自然说完
- 当前模型允许的单次生成时长
- 这一段是否拥有明确的开始状态和结束状态
- 生成后是否容易与前后素材进行剪辑
每一个视频段都应该能回答两个问题:
- 这一段从什么状态开始?
- 这一段结束以后,下一段继承什么状态?
导演镜头脚本可以使用下面的格式
第X段|预计时长:15秒
剧情目标:
这一段需要完成什么叙事任务?
开始状态:
人物、场景、道具、情绪和动作分别处于什么状态?
镜头一|预计X秒:
景别、机位、人物动作、表情、台词、环境变化。
镜头二|预计X秒:
景别、机位、人物动作、表情、台词、环境变化。
镜头三|预计X秒:
景别、机位、人物动作、表情、台词、环境变化。
结束状态:
这一段最终停在哪里?下一段需要继承什么?
资产绑定:
使用哪些人物图、服装图、场景图和道具图?
禁止项:
不能出现哪些人物、动作、物品、字幕或画面变化?
每个镜头都需要分配建议时长,而且各镜头时长相加不能超过视频段总时长。
写完以后,还要逐段检查:
- 动作和台词是否真的装得下
- 人物左右方向是否前后矛盾
- 道具是否突然出现或消失
- 动作是否违反空间关系和基本物理逻辑
- 情绪转折是否过快
- 镜头切换是否具有剪辑依据
- 结束状态能否自然连接下一段
导演镜头脚本确认后,应当先冻结版本,再开始制作资产。
第三阶段:制作并绑定视觉资产
不要一拿到剧本就开始大量生成人物图和场景图。
更稳妥的顺序是:
- 先完成导演镜头脚本,再从镜头脚本反推最少必要资产。
因为只有镜头确定以后,我们才真正知道哪些内容会进入画面。

图注:从已经冻结的导演镜头脚本反推最少必要资产,再统一编号、绑定段落并冻结版本。
资产主要包括四类
人物资产
包括:
- 脸部与发型
- 年龄和气质
- 身材比例
- 正面、侧面和背面
- 主要表情
- 明确的识别特征
服装资产
同一人物如果在不同时间或场景中更换服装,需要单独编号,不能只写“穿黑色衣服”。
场景资产
包括:
- 空间整体结构
- 入口和出口
- 主要家具位置
- 光源方向
- 时间与天气
- 可供镜头使用的不同视角
关键道具资产
只有真正影响剧情或需要特写的道具,才值得单独制作。
普通杯子、桌椅等通用物品没有必要全部生成资产,否则资产数量越多,管理成本反而越高。
资产可以来自三个方向
- 已经存在的参考图片
- 从成功视频中截取的稳定关键帧
- 重新生成的最少必要资产
确认以后,需要为每一张资产建立明确名称和版本,例如:
P01_周瑾_黑色便装_V3
P02_江寒声_灰褐针织衫_V2
S01_控制中心_夜景_V2
S02_公寓卧室_夜景_V4
D01_离婚协议_V1
随后,把资产编号绑定到具体的视频段和镜头。
不要只写“参考男主角图片”,而应该写成:
- 第6段使用 P01_V3、P02_V2 和 S02_V4。
这样即使以后更换某一张图,也能立即知道哪些视频段会受到影响。

图注:《瑾声》项目最终锁定的人物资产和场景资产。资产确认以后统一编号,并绑定到对应的视频段。
资产一旦确认,就应当锁定版本。
除非后续发现人物身份、服装逻辑或场景结构存在根本问题,否则不要在批量生成过程中频繁更换参考图。
第四阶段:先试拍,再让 Agent 批量生成
镜头脚本和资产准备完成后,不要立刻生成全部视频。
先选择一个高风险片段进行试拍。

图注:先用高风险片段验证镜头脚本、资产、提示词和模型能力;试拍通过后,再让 Agent 分发多个独立生成任务。
什么是高风险片段?
例如:
- 两个人物同框并互动
- 有明确台词和口型
- 动作接触复杂
- 需要躺下、搀扶、拥抱等身体关系
- 存在镜面、屏幕或特殊道具
- 情绪变化明显
- 场景空间关系复杂
- 同时包含多个镜头切换
如果模型连最困难的片段都能基本完成,那么批量生成的风险会小很多。
如果试拍失败,也能提前发现问题究竟来自:
- 镜头脚本过于拥挤
- 动作难度过高
- 资产不稳定
- 场景结构不清
- 提示词存在歧义
- 当前模型能力不足

图注用一个15秒高风险片段验证人物、场景、动作和镜头执行效果,再决定是否批量生成。
Agent 不是视频模型,而是任务助手
使用即梦画布 Agent 时,可以把它理解成一个能够对话的制作助理。
它可以帮助我们:
- 读取多段提示词
- 为每一段匹配人物和场景资产
- 添加统一画幅和风格要求
- 建立多个独立的视频生成任务
- 协助管理生成结果
但正因为它能够理解和处理文本,它也可能“自作聪明”地改写提示词。
例如:
- 压缩内容
- 改变镜头顺序
- 合并动作
- 改写台词
- 删除它认为重复的信息
- 重新组织已经确认的镜头
所以,交给 Agent 的指令必须明确说明:
- Agent 只负责分发和补充,不得修改已经确认的主体提示词。
可直接使用的 Agent 批量生成指令
请一次并行生成10个彼此独立的16:9真人写实视频段落,对应第1段至第10段。
不使用上一段结尾作为下一段首帧。每个段落必须根据自己的开始状态,独立建立人物、场景和道具。
在为每一段分配任务时,请把我提供的该段主体提示词原原本本放入对应的视频生成任务中。
不得删减、概括、润色、改写、合并或重新安排其中的镜头、动作、台词和执行顺序。
你需要完成的工作只有:
1. 把该段需要使用的人物、服装、场景和道具资产放在提示词开头;
2. 补充统一的画幅、风格、画质、声音和全局规则;
3. 检查段落编号、资产编号与提示词是否正确对应;
4. 为每一段建立一个彼此独立的视频生成任务。
如果资产要求、全局规则和主体提示词之间出现冲突,不要自行修改主体提示词。请先指出冲突并等待我确认。
需要特别注意的是:
- 一次提交10段任务,不等于模型直接生成一条包含10段内容的长视频。
实际发生的是:
- 用户提交一组任务 → Agent 为每段建立独立任务 → 视频模型分别生成每一个视频段。

图注:一次向 Agent 提交任务,由 Agent 分配并生成10个彼此独立的视频段,而不是生成一条超长视频。
在正式提交前,建议再做一次预演检查:
- 每段编号是否正确
- 每段主体提示词是否完整
- 人物和场景资产是否匹配
- 开始状态是否明确
- 结束状态是否为后续剪辑留下空间
- 台词和动作是否能在限定时长内完成
- 是否错误继承了上一段的结尾画面
- Agent 是否被禁止改写主体提示词
本项目先完成了高风险片段试拍,随后分批生成其余视频段,并在同一个画布中保留资产、试拍、批量结果和补拍素材。

图注:《瑾声》项目完整画布:左侧整理人物与场景资产,中间完成高风险片段试拍并分批生成其余视频段,右侧保留生成结果,最终形成20段可供剪辑的素材。
这种画布式管理的价值,不只是“一次生成很多段”,而是让资产、任务、结果和返修记录处在同一个项目空间里,便于追踪每一段使用了什么参考、为什么失败,以及后来怎样修改。
第五阶段:剪辑、返修与成片
AI 视频生成完成,并不代表作品已经完成。
生成结果只是素材。真正的成片仍然需要剪辑判断。

图注:逐段看片,把问题定位到具体镜头,再根据问题层级进行删除、替换、补拍或重新生成。
先按照实际素材粗剪
不要机械地按照镜头脚本里的预计时长剪辑。
预计时长只是生成前的规划,最终应当根据实际素材判断:
- 哪个动作真正完成了
- 哪一秒的人物状态最自然
- 哪个镜头值得保留
- 哪些停顿可以缩短
- 哪些素材虽然生成成功,但对剧情没有帮助
先使用可用素材完成粗剪,再观察整体节奏。
按问题所在的层级返修
如果问题只出现在一个镜头,可以:
- 直接删除
- 缩短镜头
- 用其他素材替换
- 从成功视频中截取可用部分
- 单独补拍一个替代镜头
如果问题影响整个视频段,例如:
- 开始状态完全错误
- 人物身份明显漂移
- 场景不一致
- 核心动作没有完成
- 台词顺序错误
- 整段空间关系混乱
这时才需要重新生成整个视频段。
这也是前面坚持“视频段内部继续拆镜头”的原因:我们希望把返工单位从整段视频缩小到单个镜头。
多余镜头可以直接删除
不是每一个生成出来的镜头都必须使用。
如果某个镜头对剧情没有帮助,即使画面本身没有明显错误,也可以删掉。
剪辑不是对生成结果的被动拼接,而是最后一次叙事创作。
最后再处理字幕和声音
画面结构基本锁定后,再进行:
- 台词和画面对时
- 字幕制作
- 环境声补充
- 音效调整
- 音乐和情绪关系检查
- 音量平衡
- 最终导出
最后进行一次整体质量检查:
- 人物是否前后一致
- 服装、场景和道具是否连续
- 情绪是否连贯
- 轴线和视线是否造成误解
- 台词是否完整
- 字幕是否正确
- 是否出现多余人物、文字、水印或异常肢体
- 画幅、分辨率和声音规格是否符合发布平台要求
五个阶段和完整工作流是什么关系?
五个阶段是帮助人快速理解的方法框架:
- 确定做多少 → 写成可生成的镜头脚本 → 准备视觉参考 → 试拍并批量生成 → 剪辑成为完整成片
但真正执行时,还需要处理大量确认节点:
- 改编方案是否通过
- 视频段是否装得下动作和台词
- 导演镜头脚本是否冻结
- 资产版本是否确认
- 高风险试拍是否通过
- Agent 是否完整保留提示词
- 问题属于镜头、资产还是节奏
- 修改是否会影响之前已经确认的内容
因此:
- 五个阶段是让读者容易理解的认知模型;完整工作流是给真正准备动手制作的人使用的执行手册。
只想理解方法,记住五个阶段即可。
准备正式开始项目,再使用下面这张完整工作流图。

图注:建议下载点击放大查看,下文有这张总流程图的代码,若此图看不清,可直接复制代码到GPT中
这套方法真正解决了什么?
回头看,这套流程最重要的并不是增加了多少步骤,而是解决了几个实际问题。
1. 先确认做多少,避免做到一半才发现项目失控
全篇、分期和节选不是生成后的决定,而是项目开始前的制作决策。
2. 把文学剧本变成模型能够执行的导演镜头脚本
模型不只需要知道“发生了什么”,还需要知道画面从哪里开始、怎样变化、最后停在哪里。
3. 不强求所有视频段首尾帧相接
长篇叙事可以利用正常的镜头切换完成连接。独立生成每段,同时保持人物、状态、情绪和空间连续,往往更加灵活。
4. 把返工单位缩小到镜头
镜头拆得清楚,后期才能删除、替换或补拍局部,而不必反复重做整段视频。
5. 把 Agent 当作助手,而不是让它替导演做决定
Agent 可以分发任务和补充资产,但主体提示词、镜头顺序、动作和台词必须由已经确认的导演镜头脚本控制。
6. 每个关键阶段都需要确认和冻结
没有确认就继续向下推进,后面的资产、提示词和视频都会建立在不稳定的基础上。
真正减少返工的,不是让 AI 一次把所有事情都做完,而是让它在正确的节点停下来,等待人做决定。
附:开启新项目时,可直接发送给 ChatGPT Work 的提示词
下面这段提示词,可以在开始一个新剧本时直接使用。
建议新建一个 ChatGPT Work 项目,选择 GPT-5.6 Sol,并把这段提示词和“完整执行工作流图”一起发送。
- 你将担任本项目的:
1. AI叙事短片导演;
2. 导演镜头脚本策划师;
3. 视觉资产规划与版本管理助手;
4. 视频生成提示词整理员;
5. 生成质量检查员;
6. 剪辑与局部返修顾问。你的任务,是协助我把一份原始剧本逐步转化为可执行、可审核、可批量生成、可局部返修的AI叙事短片制作方案。
我会在下一条消息中提供剧本、参考资料和当前准备使用的工具。
请严格遵守以下工作方式。
【一、总体原则】
1. 不要在未经确认的情况下改写原作的重要情节、人物关系、核心台词、气质和留白。
2. 如果需要删减、重排、合并或进行视觉化改编,必须先说明理由和影响,等待我确认。
3. 整个项目只使用以下五个阶段,不要另外创造重复的步骤体系:第一阶段:确定制作范围;
第二阶段:剧本变成导演镜头脚本;
第三阶段:制作并绑定视觉资产;
第四阶段:试拍与Agent批量生成;
第五阶段:剪辑、返修与成片。4. 一次只推进一个阶段。当前阶段没有获得我的确认,不得自动进入下一阶段。
5. 每个阶段确认后,记录当前版本并视为冻结。
6. 如果后续修改会影响已经冻结的内容,必须先列出受影响的阶段、视频段、镜头或资产,等待我确认是否解锁。
7. 你负责提出专业建议、发现风险和检查错误,但最终决定由我确认。【二、第一阶段:确定制作范围】
收到剧本后,先完成以下工作:
1. 提取必须保留的情节、人物、台词、气质和留白;
2. 估算原剧本适合生成的总时长;
3. 判断更适合:
– 全篇一次完成;
– 全篇分期完成;
– 选择一个相对完整的片段;
4. 如果不能全篇生成,提出建议的内容边界,并说明为什么从这里开始、到这里结束;
5. 确认目标平台、画幅、视觉风格、声音方案和改编尺度;
6. 确认视频工具的能力边界,包括:
– 单段最长生成时长;
– 可用的图片或视频参考方式;
– Agent批量任务能力;
– Agent是否可能改写提示词;
– 单段成本及返修预算;
7. 给出预计成片时长、视频段数量和制作范围建议。完成后停止,等待我确认。
【三、第二阶段:剧本变成导演镜头脚本】
第一阶段确认后:
1. 把确认范围内的剧本拆成多个独立视频段;
2. 一个视频段对应一次独立的视频生成任务;
3. 每个视频段继续拆成镜头一、镜头二、镜头三;
4. 为每个镜头分配建议持续时长,并检查相加后是否超过视频段总时长;
5. 每个视频段必须写清:
– 剧情目标;
– 开始状态;
– 各镜头的景别、机位、动作、表情、台词和声音;
– 结束状态;
– 与前后段的剪辑关系;
– 资产需求;
– 禁止项;
6. 默认采用“独立视频段+镜头剪辑连续”的方法,不强制使用上一段结尾作为下一段首帧;
7. 仍需检查人物身份、服装、场景、道具、动作结果、情绪、视线、轴线和光线的连续性;
8. 逐段检查动作、台词和情绪是否能在限定时长内完成;
9. 如果装不下,优先压缩动作、调整镜头时长或拆分视频段,不要让模型强行完成过多内容。完成后停止,等待我确认并冻结导演镜头脚本。
【四、第三阶段:制作并绑定视觉资产】
导演镜头脚本确认后:
1. 从已经冻结的镜头脚本反推最少必要资产;
2. 分别整理:
– 人物;
– 服装;
– 场景;
– 关键道具;
3. 不要生成镜头中不会实际出现的冗余资产;
4. 对已有图片、成功视频关键帧和仍需生成的资产进行分类;
5. 为每项资产建立明确编号、名称和版本;
6. 把资产绑定到对应的视频段和镜头;
7. 如果单张人物图或场景图在工作模式中反复生成不理想,可以建议我把已经确认的描述和参考图带到普通聊天中单独生成,但不得擅自改变资产设定;
8. 资产确认后冻结版本,不得在批量生成过程中随意更换。完成后停止,等待我确认。
【五、第四阶段:试拍与Agent批量生成】
资产确认后:
1. 选择一个动作、同框、台词、空间关系或情绪难度较高的视频段进行试拍;
2. 检查人物一致性、场景、动作、台词、镜头执行和整体风格;
3. 试拍没有通过时,先判断问题来自镜头脚本、资产、提示词还是模型能力;
4. 只有在试拍通过后,才整理批量生成任务;
5. 为每个视频段绑定正确的资产;
6. 编写Agent总指令时,必须明确:
– 每段是彼此独立的视频任务;
– 不使用上一段结尾作为下一段首帧;
– 每段根据自己的开始状态独立建立人物、场景和道具;
– 每段主体提示词原样保留;
– Agent不得删减、概括、润色、改写、合并或重新安排镜头、动作、台词和顺序;
– Agent只负责补充资产、全局风格、画幅、画质和规则,并建立独立任务;
7. 批量提交前,检查段落编号、资产编号、开始状态、结束状态、时长、台词和禁止项;
8. 如果发现冲突,不得自行修改已经冻结的主体提示词,必须先报告。完成后停止,等待我确认是否提交生成。
【六、第五阶段:剪辑、返修与成片】
收到生成素材后:
1. 按照实际可用素材规划粗剪,不机械照搬预计时长;
2. 逐段看片,并把问题定位到具体镜头;
3. 如果只影响一个镜头,优先建议:
– 删除;
– 缩短;
– 替换;
– 截取其他可用素材;
– 单独补拍;
4. 只有当开始状态、人物身份、场景、核心动作、台词顺序或整段逻辑错误时,才建议重新生成整个视频段;
5. 对资产漂移、动作错误、台词问题和节奏问题分别提出解决方案;
6. 画面结构锁定以后,再处理字幕、声音、音乐、终检和导出;
7. 最终检查人物、服装、场景、道具、情绪、轴线、台词、字幕、声音、异常画面和发布规格。【七、每个阶段的输出格式】
每次只输出当前阶段,并按以下结构组织:
1. 当前阶段目标;
2. 分析与判断;
3. 本阶段结果;
4. 风险和待确认问题;
5. 需要我作出的决定。每个阶段结尾必须写:
“以上为当前阶段结果。请审核;如果没有问题,请回复‘确认’,我再进入下一阶段。”
当你第一次收到本提示词和工作流图时,不要提前分析尚未发送的剧本,只回复:
“工作流程已载入。请发送剧本、参考图片、目标成片风格,以及已经确定的视频工具和限制。收到后,我将从第一阶段开始。”
flowchart TD
A[“提供原始剧本与参考资料”] –> B[“明确项目目标<br/>平台、画幅、风格、目标时长、声音、改编尺度”]
B –> C[“提取原作核心<br/>必须保留的情节、人物、台词、气质与留白”]
C –> C1[“估算完整剧本时长与制作成本<br/>核对模型时长、批量能力、参考方式与积分”]
C1 –> C2{“是否全篇生成?”}
C2 — “是” –> D[“可视化适配与节奏规划<br/>叙事节点、注意力曲线、核心段与可选段”]
C2 — “否” –> C3[“选择分期制作<br/>或截取相对完整的剧情片段”]
C3 –> D
D –> E{“改编方案确认?”}
E — “否” –> D
E — “是” –> F[“拆成5—15秒独立视频段<br/>一段对应一次视频生成”]
F –> G[“编写导演镜头脚本<br/>每段继续拆成镜头一、镜头二、镜头三……”]
G –> H[“为每个镜头分配建议持续时长<br/>相加校验段落总时长”]
H –> I{“动作、台词与情绪装得下吗?”}
I — “否” –> J[“压缩动作、调整时长或拆分段落”]
J –> G
I — “是” –> K[“逐段逐镜头技术排错<br/>方向、动作、空间、物理、道具、切镜、台词”]
K –> L{“导演镜头脚本确认并冻结?”}
L — “否” –> M[“只修改问题段落或问题镜头”]
M –> H
L — “是” –> N[“反推并压缩资产清单<br/>角色、服装、场景、关键道具”]
N –> O{“资产来源?”}
O — “已有图片” –> P[“整理现有资产”]
O — “已有成功视频” –> Q[“截取稳定关键帧”]
O — “仍然缺少” –> R[“生成最少必要资产<br/>Work效果不理想时可转聊天模式生成”]
P –> S[“统一资产名称、版本与继承规则”]
Q –> S
R –> S
S –> T{“资产确认并冻结?”}
T — “否” –> N
T — “是” –> U[“将资产绑定到对应段落和镜头”]
U –> U1[“选择连续性或动作风险较高的<br/>一个视频段进行试拍”]
U1 –> U2{“试拍是否通过?”}
U2 — “否” –> U3[“定位并修改受影响的<br/>镜头脚本、资产或提示词”]
U3 –> U1
U2 — “是” –> V[“整合即梦Agent总指令<br/>全局规则+资产绑定+各段独立提示词<br/>禁止Agent改写镜头主体提示词”]
V –> W[“提交前预演检查<br/>独立开始状态、剪辑连续性、资产、台词、声音、时长”]
W –> X{“可以提交?”}
X — “否” –> Y[“只修改受影响的提示词或资产映射”]
Y –> V
X — “是” –> Z[“即梦Agent一次提交剩余段落<br/>分配为多个彼此独立的视频生成任务”]
Z –> ZA[“逐段看片并定位问题”]
ZA –> ZB{“问题属于哪一层?”}
ZB — “局部镜头、动作或台词” –> ZC[“删除、缩短、补生成或替换问题镜头<br/>必要时才重生成对应段落”]
ZB — “资产漂移” –> ZD[“强化资产描述或图片引用<br/>重生成受影响段落”]
ZB — “节奏或段落划分” –> ZE[“调整镜头时长、密度或段落划分<br/>重生成受影响段落”]
ZC –> ZA
ZD –> ZA
ZE –> ZA
ZB — “全部通过” –> ZF[“剪辑合并、声音校正<br/>字幕文字与最终成片”]
使用方法
- 新建一个 ChatGPT Work 项目。
- 选择 GPT-5.6 Sol。
- 把上面的启动提示词和完整执行工作流图一起发送。
- 再发送剧本、参考图片、目标风格和工具限制。
- AI 每次只完成一个阶段。
- 没有问题就回复“确认”;有问题就指出需要修改的部分。
- 五个阶段全部完成后,再把已经确认的资产和生成提示词交给视频端执行。
这样,人的主要工作就从“亲自处理全部细节”,变成了:
- 决定方向、审核结果、确认版本,以及在关键节点纠正问题。
结语
AI 叙事短片并不是把剧本复制进生成器,然后等待模型自动完成。
它更像一次小型影视制作:
- 剧本决定讲什么
- 导演镜头脚本决定怎样呈现
- 视觉资产约束人物和世界
- Agent 负责分发和组织任务
- 视频模型负责生成素材
- 剪辑和返修最终决定故事能否成立
这套方法的核心,也不是增加流程的复杂度,而是把复杂工作放到正确的阶段解决。
只想看懂这套方法,记住五个阶段就够了。
真正准备动手时,再使用完整工作流和阶段确认机制:先确定范围,再逐步拆解;先试拍,再批量生成;出现问题时,只修出错的镜头或视频段。
当每个阶段都有明确的输入、输出和确认标准以后,AI 就不再只是一个随机生成画面的工具,而会逐渐成为一套可管理、可审核、可迭代的叙事制作系统。