一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

用 AI 生成一个十几秒的好看画面,现在已经不算特别困难。

真正困难的是:
当一个故事需要几十个镜头、多个场景和多次生成时,怎样让人物、画风、剧情状态和情绪保持连贯;
抽卡失败后,怎样以最小的成本去修改,只解决出问题的部分,而不是把整段视频全部推倒重来。

(文章最后有附录提示词,如果嫌本文太长不想看,可以直接复制附录提示词到GPT即可立刻尝试)

这次,我们以《瑾声》为案例,尝试把一部长篇剧本转化为一支约四分半钟的 AI 叙事短片。

因为原剧本较长,不原创剧本,所以我们没有一开始就追求全篇生成,而是先选择了其中一段相对完整、能够独立呈现的内容。最终,这部分剧情被拆成20个彼此独立的视频段,再通过剪辑组成完整短片。

在这个过程中,我们逐渐整理出一套可以重复使用的制作方法。

如果只是想快速看懂整个方法,记住下面五个阶段就够了;
如果准备真正开始制作,再使用后文的完整工作流、确认节点和启动提示词。

整个流程,可以先理解成五个阶段

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:先确定做多少,再把剧本变成可生成的导演镜头脚本,随后准备资产、批量生成,最后通过剪辑和局部返修完成成片。

这五个阶段分别是:

  1. 确定制作范围
  2. 剧本变成导演镜头脚本
  3. 制作并绑定视觉资产
  4. 试拍与 Agent 批量生成
  5. 剪辑、返修与成片

它们是帮助读者快速理解的“认知框架”。

真正执行时,每个阶段内部还会包含判断、确认、冻结、返修和回退。因此,文章后面还会提供一张更完整的执行工作流。

本项目使用了哪些工具?

这套方法并不依赖某一个固定软件,但需要区分四类工作:

  • 剧本分析、导演规划与质量审核
  • 人物和场景等视觉资产制作
  • 视频生成与批量任务分发
  • 剪辑、声音、字幕与最终输出

本项目的主要工具组合如下。

1. 规划端:ChatGPT Work+GPT-5.6 Sol

ChatGPT Work,也就是工作模式,负责管理较长的工作流程、读取剧本、拆解任务、记录确认结果,并在每个阶段等待人工审核。

官方将 Work 定位为可以结合目标、文件和上下文,完成文档、表格、演示文稿等可持续审阅成果的工作模式。

GPT-5.6 Sol 则用于剧本分析、导演镜头规划、连续性检查、提示词整理和生成结果的质量判断。官方将它定位为适合复杂专业工作的前沿模型。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:规划端使用工作模式和 GPT-5.6 Sol,负责拆解、规划、检查和阶段确认。

2. 资产端:ChatGPT 图片生成

人物设定图、服装参考图、场景参考图和关键道具图,可以直接在 ChatGPT 中生成和调整。

我的实际经验是:工作模式适合管理整个项目,但如果某一张人物图或场景图反复生成不理想,可以把已经确认的资产描述和参考图单独带到普通聊天中迭代图片。

这并不是说两种模式一定存在固定的质量差异,而是单张图片在普通聊天中往往更容易集中调整,不会被整个项目的复杂上下文干扰。

3. 生成端:即梦画布 Agent+Seedance

本项目的视频生成部分使用了即梦画布中的 Agent 模式,并采用 Seedance 2.0 Mini 进行视频生成。

这里需要区分“Agent”和“视频模型”:

  • 视频模型负责真正生成某一个视频段。
  • Agent 更像一个可以对话的任务助手,负责读取要求、匹配资产、分发任务和组织多段生成。

也就是说,我们可以一次把多段任务交给 Agent,但它并不是直接生成一条超长视频,而是把这些内容分配成多个彼此独立的视频生成任务。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:生成端使用即梦画布 Agent 模式,设置16:9画幅,并选择相应的视频生成模型。

需要说明的是,本文记录的是本项目制作时的工具状态。模型版本、单段时长、批量数量、积分价格和界面功能都可能继续变化。

因此,真正开始一个新项目之前,必须重新确认当前工具的能力边界,不能把本文中的具体数字当成永久规则。

第一阶段:先确定制作范围

很多项目并不是败在生成质量上,而是败在一开始没有决定“究竟要做多少”。

制作范围一旦没有确定,后面的镜头脚本、资产数量、生成成本和制作周期都会处于不断变化的状态。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:先确认项目目标、原作核心、工具能力和生成成本,再决定全篇完成、分期完成,还是选择一个相对完整的片段。

一部长篇剧本通常可以采用三种制作方式。

方式一:全篇一次完成

适合以下情况:

  • 剧本本身不长
  • 故事已经比较完善
  • 总时长和预算可控
  • 希望最终得到一部完整作品

这里的“一次完成”,指的是在同一个制作周期内完成整个剧本,并不是让视频模型一次生成一条超长视频。

如果是自己创作、已经打磨成熟的剧本,只要工具、时间和预算允许,通常可以优先考虑全篇制作。

方式二:全篇分期完成

适合以下情况:

  • 故事值得完整制作
  • 但一次完成的成本、时长或管理难度过高
  • 可以按照章节、场景或剧情单元分期推进

这种方式并不是放弃完整作品,而是先把完整目标拆成多个制作周期。

方式三:选择一个相对完整的片段

适合以下情况:

  • 原剧本非常长
  • 当前项目主要用于测试方法
  • 预算有限
  • 原作不是自己的作品
  • 只需要呈现其中一个完整的戏剧单元

《瑾声》采用的就是这种方式:从长篇剧本中选择一段相对完整的内容,最终制作成约四分半钟的叙事短片。

关键是:这个决定必须在拆镜头之前完成。

如果做到一半才发现预算不够、模型时长不够,前面已经写好的镜头、资产和提示词都会受到影响。

同时确认工具边界

确定内容范围时,还要一起确认:

  • 当前模型单次最多能生成多长
  • 支持哪些画幅和分辨率
  • 支持首尾帧、图片参考还是全能参考
  • 每次任务可以引用多少资产
  • Agent 一次可以分发多少任务
  • Agent 是否会自动改写提示词
  • 每段生成消耗多少积分
  • 需要预留多少试拍和返修成本

本项目采用的是5—15秒左右的独立视频段,但这只是当时的项目方案,不是所有模型都必须采用这个长度。

先估算成本,再决定范围

在本项目制作时,Seedance 2.0 Mini 在不打折的情况下,生成一个15秒视频段消耗130积分。

这只是本项目当时的历史成本记录,不代表现在或其他模型仍然采用同样的价格。

可以先用下面的方式做粗略预算:

  • 基础生成成本=预计视频段数量×单段积分
    项目预算=基础生成成本+试拍成本+返修预留

如果预计生成20段,就不能只准备20段的积分,还要为高风险片段试拍、失败重生和局部补拍留出空间。

第一阶段最终需要确认的,不是一句模糊的“我要做一支视频”,而是一张明确的范围说明:

  • 做全篇、分期还是节选
  • 目标成片时长
  • 目标平台和画幅
  • 视觉风格
  • 声音和台词方案
  • 使用的模型与工具
  • 大致视频段数量
  • 成本与返修余量

第二阶段:把剧本变成导演镜头脚本

原始剧本不能直接等同于视频生成提示词。

剧本主要描述人物、事件、台词和情绪;视频模型需要知道的则是:

  • 当前画面里有什么
  • 人物从什么状态开始
  • 人物做了什么动作
  • 摄影机怎样观察
  • 镜头什么时候切换
  • 这一段最终停在什么状态

因此,我们需要先把剧本转化成导演镜头脚本。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:先把故事拆成独立视频段,再继续拆成具体镜头;为每个镜头分配时长,并检查动作、台词、情绪和剪辑连续性。

先区分“视频段”和“镜头”

这两个概念不能混在一起。

视频段

一个视频段,对应一次独立的视频生成任务。

例如第1段、第2段、第3段,分别由视频模型单独生成。

镜头

镜头是一个视频段内部的画面单位。

例如一个15秒视频段内部,可以包含:

  • 镜头一:人物走进房间
  • 镜头二:切到另一个人物的反应
  • 镜头三:两人对话
  • 镜头四:特写某个关键道具

因此,一次视频生成不一定只有一个镜头。

为什么每个视频段内部还要继续拆镜头?

主要有三个原因。

第一,控制节奏

如果只告诉模型“生成一段15秒的两人对话”,模型很可能自行决定景别、节奏和动作,结果未必符合叙事需要。

拆成镜头一、镜头二、镜头三以后,画面重点和时间分配会更加明确。

第二,让不同视频段通过剪辑自然连接

传统的连续生成方式,经常会把上一段结尾作为下一段首帧,以此约束人物位置和画面连续性。

这种方法适合:

  • 一镜到底
  • 连续运动
  • 精确的镜头延续
  • 必须保持同一动作轨迹的场面

但长篇叙事通常包含大量镜头切换,并不需要每一段都严格首尾相接。

本项目采用的是另一种思路:

  • 每个视频段独立生成,不使用上一段结尾作为下一段首帧;视频段之间依靠正常的镜头切换和状态连续性完成衔接。

我们放弃的是严格的“帧级连续”,但仍然保留:

  • 人物身份连续
  • 服装连续
  • 场景和时间连续
  • 道具状态连续
  • 动作结果连续
  • 情绪连续
  • 视线和轴线连续
  • 光线与整体风格连续

这样既减少了首尾帧接力带来的僵硬,也更接近传统影视剪辑的工作方式。

第三,为后期返修留下最小修改单位

如果一个15秒视频段里有四个镜头,其中只有第三个镜头出现问题,我们可以:

  • 删除第三个镜头
  • 缩短第三个镜头
  • 用其他素材替换
  • 只补拍一个新镜头

不一定要把整段15秒视频全部重新生成。

这也是为什么镜头拆分不仅服务于生成,还直接决定后期返工成本。

按什么规则拆分视频段?

可以综合考虑以下因素:

  • 场景是否发生变化
  • 时间是否发生变化
  • 人物动作是否形成一个完整单位
  • 情绪是否完成一次转折
  • 台词是否能在限定时长内自然说完
  • 当前模型允许的单次生成时长
  • 这一段是否拥有明确的开始状态和结束状态
  • 生成后是否容易与前后素材进行剪辑

每一个视频段都应该能回答两个问题:

  1. 这一段从什么状态开始?
  2. 这一段结束以后,下一段继承什么状态?

导演镜头脚本可以使用下面的格式

第X段|预计时长:15秒

剧情目标:
这一段需要完成什么叙事任务?

开始状态:
人物、场景、道具、情绪和动作分别处于什么状态?

镜头一|预计X秒:
景别、机位、人物动作、表情、台词、环境变化。

镜头二|预计X秒:
景别、机位、人物动作、表情、台词、环境变化。

镜头三|预计X秒:
景别、机位、人物动作、表情、台词、环境变化。

结束状态:
这一段最终停在哪里?下一段需要继承什么?

资产绑定:
使用哪些人物图、服装图、场景图和道具图?

禁止项:
不能出现哪些人物、动作、物品、字幕或画面变化?

每个镜头都需要分配建议时长,而且各镜头时长相加不能超过视频段总时长。

写完以后,还要逐段检查:

  • 动作和台词是否真的装得下
  • 人物左右方向是否前后矛盾
  • 道具是否突然出现或消失
  • 动作是否违反空间关系和基本物理逻辑
  • 情绪转折是否过快
  • 镜头切换是否具有剪辑依据
  • 结束状态能否自然连接下一段

导演镜头脚本确认后,应当先冻结版本,再开始制作资产。

第三阶段:制作并绑定视觉资产

不要一拿到剧本就开始大量生成人物图和场景图。

更稳妥的顺序是:

  • 先完成导演镜头脚本,再从镜头脚本反推最少必要资产。

因为只有镜头确定以后,我们才真正知道哪些内容会进入画面。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:从已经冻结的导演镜头脚本反推最少必要资产,再统一编号、绑定段落并冻结版本。

资产主要包括四类

人物资产

包括:

  • 脸部与发型
  • 年龄和气质
  • 身材比例
  • 正面、侧面和背面
  • 主要表情
  • 明确的识别特征

服装资产

同一人物如果在不同时间或场景中更换服装,需要单独编号,不能只写“穿黑色衣服”。

场景资产

包括:

  • 空间整体结构
  • 入口和出口
  • 主要家具位置
  • 光源方向
  • 时间与天气
  • 可供镜头使用的不同视角

关键道具资产

只有真正影响剧情或需要特写的道具,才值得单独制作。

普通杯子、桌椅等通用物品没有必要全部生成资产,否则资产数量越多,管理成本反而越高。

资产可以来自三个方向

  • 已经存在的参考图片
  • 从成功视频中截取的稳定关键帧
  • 重新生成的最少必要资产

确认以后,需要为每一张资产建立明确名称和版本,例如:

P01_周瑾_黑色便装_V3
P02_江寒声_灰褐针织衫_V2
S01_控制中心_夜景_V2
S02_公寓卧室_夜景_V4
D01_离婚协议_V1

随后,把资产编号绑定到具体的视频段和镜头。

不要只写“参考男主角图片”,而应该写成:

  • 第6段使用 P01_V3、P02_V2 和 S02_V4。

这样即使以后更换某一张图,也能立即知道哪些视频段会受到影响。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:《瑾声》项目最终锁定的人物资产和场景资产。资产确认以后统一编号,并绑定到对应的视频段。

资产一旦确认,就应当锁定版本。

除非后续发现人物身份、服装逻辑或场景结构存在根本问题,否则不要在批量生成过程中频繁更换参考图。

第四阶段:先试拍,再让 Agent 批量生成

镜头脚本和资产准备完成后,不要立刻生成全部视频。

先选择一个高风险片段进行试拍。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:先用高风险片段验证镜头脚本、资产、提示词和模型能力;试拍通过后,再让 Agent 分发多个独立生成任务。

什么是高风险片段?

例如:

  • 两个人物同框并互动
  • 有明确台词和口型
  • 动作接触复杂
  • 需要躺下、搀扶、拥抱等身体关系
  • 存在镜面、屏幕或特殊道具
  • 情绪变化明显
  • 场景空间关系复杂
  • 同时包含多个镜头切换

如果模型连最困难的片段都能基本完成,那么批量生成的风险会小很多。

如果试拍失败,也能提前发现问题究竟来自:

  • 镜头脚本过于拥挤
  • 动作难度过高
  • 资产不稳定
  • 场景结构不清
  • 提示词存在歧义
  • 当前模型能力不足

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注用一个15秒高风险片段验证人物、场景、动作和镜头执行效果,再决定是否批量生成。

Agent 不是视频模型,而是任务助手

使用即梦画布 Agent 时,可以把它理解成一个能够对话的制作助理。

它可以帮助我们:

  • 读取多段提示词
  • 为每一段匹配人物和场景资产
  • 添加统一画幅和风格要求
  • 建立多个独立的视频生成任务
  • 协助管理生成结果

但正因为它能够理解和处理文本,它也可能“自作聪明”地改写提示词。

例如:

  • 压缩内容
  • 改变镜头顺序
  • 合并动作
  • 改写台词
  • 删除它认为重复的信息
  • 重新组织已经确认的镜头

所以,交给 Agent 的指令必须明确说明:

  • Agent 只负责分发和补充,不得修改已经确认的主体提示词。

可直接使用的 Agent 批量生成指令

请一次并行生成10个彼此独立的16:9真人写实视频段落,对应第1段至第10段。

不使用上一段结尾作为下一段首帧。每个段落必须根据自己的开始状态,独立建立人物、场景和道具。

在为每一段分配任务时,请把我提供的该段主体提示词原原本本放入对应的视频生成任务中。

不得删减、概括、润色、改写、合并或重新安排其中的镜头、动作、台词和执行顺序。

你需要完成的工作只有:

1. 把该段需要使用的人物、服装、场景和道具资产放在提示词开头;
2. 补充统一的画幅、风格、画质、声音和全局规则;
3. 检查段落编号、资产编号与提示词是否正确对应;
4. 为每一段建立一个彼此独立的视频生成任务。

如果资产要求、全局规则和主体提示词之间出现冲突,不要自行修改主体提示词。请先指出冲突并等待我确认。

需要特别注意的是:

  • 一次提交10段任务,不等于模型直接生成一条包含10段内容的长视频。

实际发生的是:

  • 用户提交一组任务 → Agent 为每段建立独立任务 → 视频模型分别生成每一个视频段。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:一次向 Agent 提交任务,由 Agent 分配并生成10个彼此独立的视频段,而不是生成一条超长视频。

在正式提交前,建议再做一次预演检查:

  • 每段编号是否正确
  • 每段主体提示词是否完整
  • 人物和场景资产是否匹配
  • 开始状态是否明确
  • 结束状态是否为后续剪辑留下空间
  • 台词和动作是否能在限定时长内完成
  • 是否错误继承了上一段的结尾画面
  • Agent 是否被禁止改写主体提示词

本项目先完成了高风险片段试拍,随后分批生成其余视频段,并在同一个画布中保留资产、试拍、批量结果和补拍素材。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:《瑾声》项目完整画布:左侧整理人物与场景资产,中间完成高风险片段试拍并分批生成其余视频段,右侧保留生成结果,最终形成20段可供剪辑的素材。

这种画布式管理的价值,不只是“一次生成很多段”,而是让资产、任务、结果和返修记录处在同一个项目空间里,便于追踪每一段使用了什么参考、为什么失败,以及后来怎样修改。

第五阶段:剪辑、返修与成片

AI 视频生成完成,并不代表作品已经完成。

生成结果只是素材。真正的成片仍然需要剪辑判断。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:逐段看片,把问题定位到具体镜头,再根据问题层级进行删除、替换、补拍或重新生成。

先按照实际素材粗剪

不要机械地按照镜头脚本里的预计时长剪辑。

预计时长只是生成前的规划,最终应当根据实际素材判断:

  • 哪个动作真正完成了
  • 哪一秒的人物状态最自然
  • 哪个镜头值得保留
  • 哪些停顿可以缩短
  • 哪些素材虽然生成成功,但对剧情没有帮助

先使用可用素材完成粗剪,再观察整体节奏。

按问题所在的层级返修

如果问题只出现在一个镜头,可以:

  • 直接删除
  • 缩短镜头
  • 用其他素材替换
  • 从成功视频中截取可用部分
  • 单独补拍一个替代镜头

如果问题影响整个视频段,例如:

  • 开始状态完全错误
  • 人物身份明显漂移
  • 场景不一致
  • 核心动作没有完成
  • 台词顺序错误
  • 整段空间关系混乱

这时才需要重新生成整个视频段。

这也是前面坚持“视频段内部继续拆镜头”的原因:我们希望把返工单位从整段视频缩小到单个镜头。

多余镜头可以直接删除

不是每一个生成出来的镜头都必须使用。

如果某个镜头对剧情没有帮助,即使画面本身没有明显错误,也可以删掉。

剪辑不是对生成结果的被动拼接,而是最后一次叙事创作。

最后再处理字幕和声音

画面结构基本锁定后,再进行:

  • 台词和画面对时
  • 字幕制作
  • 环境声补充
  • 音效调整
  • 音乐和情绪关系检查
  • 音量平衡
  • 最终导出

最后进行一次整体质量检查:

  • 人物是否前后一致
  • 服装、场景和道具是否连续
  • 情绪是否连贯
  • 轴线和视线是否造成误解
  • 台词是否完整
  • 字幕是否正确
  • 是否出现多余人物、文字、水印或异常肢体
  • 画幅、分辨率和声音规格是否符合发布平台要求

五个阶段和完整工作流是什么关系?

五个阶段是帮助人快速理解的方法框架:

  • 确定做多少 → 写成可生成的镜头脚本 → 准备视觉参考 → 试拍并批量生成 → 剪辑成为完整成片

但真正执行时,还需要处理大量确认节点:

  • 改编方案是否通过
  • 视频段是否装得下动作和台词
  • 导演镜头脚本是否冻结
  • 资产版本是否确认
  • 高风险试拍是否通过
  • Agent 是否完整保留提示词
  • 问题属于镜头、资产还是节奏
  • 修改是否会影响之前已经确认的内容

因此:

  • 五个阶段是让读者容易理解的认知模型;完整工作流是给真正准备动手制作的人使用的执行手册。

只想理解方法,记住五个阶段即可。

准备正式开始项目,再使用下面这张完整工作流图。

一人团队AI视频商业出片实战教程,从0到1跑通AI短片制作全流程SOP

图注:建议下载点击放大查看,下文有这张总流程图的代码,若此图看不清,可直接复制代码到GPT中

这套方法真正解决了什么?

回头看,这套流程最重要的并不是增加了多少步骤,而是解决了几个实际问题。

1. 先确认做多少,避免做到一半才发现项目失控

全篇、分期和节选不是生成后的决定,而是项目开始前的制作决策。

2. 把文学剧本变成模型能够执行的导演镜头脚本

模型不只需要知道“发生了什么”,还需要知道画面从哪里开始、怎样变化、最后停在哪里。

3. 不强求所有视频段首尾帧相接

长篇叙事可以利用正常的镜头切换完成连接。独立生成每段,同时保持人物、状态、情绪和空间连续,往往更加灵活。

4. 把返工单位缩小到镜头

镜头拆得清楚,后期才能删除、替换或补拍局部,而不必反复重做整段视频。

5. 把 Agent 当作助手,而不是让它替导演做决定

Agent 可以分发任务和补充资产,但主体提示词、镜头顺序、动作和台词必须由已经确认的导演镜头脚本控制。

6. 每个关键阶段都需要确认和冻结

没有确认就继续向下推进,后面的资产、提示词和视频都会建立在不稳定的基础上。

真正减少返工的,不是让 AI 一次把所有事情都做完,而是让它在正确的节点停下来,等待人做决定。

附:开启新项目时,可直接发送给 ChatGPT Work 的提示词

下面这段提示词,可以在开始一个新剧本时直接使用。

建议新建一个 ChatGPT Work 项目,选择 GPT-5.6 Sol,并把这段提示词和“完整执行工作流图”一起发送。

  • 你将担任本项目的:

    1. AI叙事短片导演;
    2. 导演镜头脚本策划师;
    3. 视觉资产规划与版本管理助手;
    4. 视频生成提示词整理员;
    5. 生成质量检查员;
    6. 剪辑与局部返修顾问。

    你的任务,是协助我把一份原始剧本逐步转化为可执行、可审核、可批量生成、可局部返修的AI叙事短片制作方案。

    我会在下一条消息中提供剧本、参考资料和当前准备使用的工具。

    请严格遵守以下工作方式。

    【一、总体原则】

    1. 不要在未经确认的情况下改写原作的重要情节、人物关系、核心台词、气质和留白。
    2. 如果需要删减、重排、合并或进行视觉化改编,必须先说明理由和影响,等待我确认。
    3. 整个项目只使用以下五个阶段,不要另外创造重复的步骤体系:

    第一阶段:确定制作范围;
    第二阶段:剧本变成导演镜头脚本;
    第三阶段:制作并绑定视觉资产;
    第四阶段:试拍与Agent批量生成;
    第五阶段:剪辑、返修与成片。

    4. 一次只推进一个阶段。当前阶段没有获得我的确认,不得自动进入下一阶段。
    5. 每个阶段确认后,记录当前版本并视为冻结。
    6. 如果后续修改会影响已经冻结的内容,必须先列出受影响的阶段、视频段、镜头或资产,等待我确认是否解锁。
    7. 你负责提出专业建议、发现风险和检查错误,但最终决定由我确认。

    【二、第一阶段:确定制作范围】

    收到剧本后,先完成以下工作:

    1. 提取必须保留的情节、人物、台词、气质和留白;
    2. 估算原剧本适合生成的总时长;
    3. 判断更适合:
    – 全篇一次完成;
    – 全篇分期完成;
    – 选择一个相对完整的片段;
    4. 如果不能全篇生成,提出建议的内容边界,并说明为什么从这里开始、到这里结束;
    5. 确认目标平台、画幅、视觉风格、声音方案和改编尺度;
    6. 确认视频工具的能力边界,包括:
    – 单段最长生成时长;
    – 可用的图片或视频参考方式;
    – Agent批量任务能力;
    – Agent是否可能改写提示词;
    – 单段成本及返修预算;
    7. 给出预计成片时长、视频段数量和制作范围建议。

    完成后停止,等待我确认。

    【三、第二阶段:剧本变成导演镜头脚本】

    第一阶段确认后:

    1. 把确认范围内的剧本拆成多个独立视频段;
    2. 一个视频段对应一次独立的视频生成任务;
    3. 每个视频段继续拆成镜头一、镜头二、镜头三;
    4. 为每个镜头分配建议持续时长,并检查相加后是否超过视频段总时长;
    5. 每个视频段必须写清:
    – 剧情目标;
    – 开始状态;
    – 各镜头的景别、机位、动作、表情、台词和声音;
    – 结束状态;
    – 与前后段的剪辑关系;
    – 资产需求;
    – 禁止项;
    6. 默认采用“独立视频段+镜头剪辑连续”的方法,不强制使用上一段结尾作为下一段首帧;
    7. 仍需检查人物身份、服装、场景、道具、动作结果、情绪、视线、轴线和光线的连续性;
    8. 逐段检查动作、台词和情绪是否能在限定时长内完成;
    9. 如果装不下,优先压缩动作、调整镜头时长或拆分视频段,不要让模型强行完成过多内容。

    完成后停止,等待我确认并冻结导演镜头脚本。

    【四、第三阶段:制作并绑定视觉资产】

    导演镜头脚本确认后:

    1. 从已经冻结的镜头脚本反推最少必要资产;
    2. 分别整理:
    – 人物;
    – 服装;
    – 场景;
    – 关键道具;
    3. 不要生成镜头中不会实际出现的冗余资产;
    4. 对已有图片、成功视频关键帧和仍需生成的资产进行分类;
    5. 为每项资产建立明确编号、名称和版本;
    6. 把资产绑定到对应的视频段和镜头;
    7. 如果单张人物图或场景图在工作模式中反复生成不理想,可以建议我把已经确认的描述和参考图带到普通聊天中单独生成,但不得擅自改变资产设定;
    8. 资产确认后冻结版本,不得在批量生成过程中随意更换。

    完成后停止,等待我确认。

    【五、第四阶段:试拍与Agent批量生成】

    资产确认后:

    1. 选择一个动作、同框、台词、空间关系或情绪难度较高的视频段进行试拍;
    2. 检查人物一致性、场景、动作、台词、镜头执行和整体风格;
    3. 试拍没有通过时,先判断问题来自镜头脚本、资产、提示词还是模型能力;
    4. 只有在试拍通过后,才整理批量生成任务;
    5. 为每个视频段绑定正确的资产;
    6. 编写Agent总指令时,必须明确:
    – 每段是彼此独立的视频任务;
    – 不使用上一段结尾作为下一段首帧;
    – 每段根据自己的开始状态独立建立人物、场景和道具;
    – 每段主体提示词原样保留;
    – Agent不得删减、概括、润色、改写、合并或重新安排镜头、动作、台词和顺序;
    – Agent只负责补充资产、全局风格、画幅、画质和规则,并建立独立任务;
    7. 批量提交前,检查段落编号、资产编号、开始状态、结束状态、时长、台词和禁止项;
    8. 如果发现冲突,不得自行修改已经冻结的主体提示词,必须先报告。

    完成后停止,等待我确认是否提交生成。

    【六、第五阶段:剪辑、返修与成片】

    收到生成素材后:

    1. 按照实际可用素材规划粗剪,不机械照搬预计时长;
    2. 逐段看片,并把问题定位到具体镜头;
    3. 如果只影响一个镜头,优先建议:
    – 删除;
    – 缩短;
    – 替换;
    – 截取其他可用素材;
    – 单独补拍;
    4. 只有当开始状态、人物身份、场景、核心动作、台词顺序或整段逻辑错误时,才建议重新生成整个视频段;
    5. 对资产漂移、动作错误、台词问题和节奏问题分别提出解决方案;
    6. 画面结构锁定以后,再处理字幕、声音、音乐、终检和导出;
    7. 最终检查人物、服装、场景、道具、情绪、轴线、台词、字幕、声音、异常画面和发布规格。

    【七、每个阶段的输出格式】

    每次只输出当前阶段,并按以下结构组织:

    1. 当前阶段目标;
    2. 分析与判断;
    3. 本阶段结果;
    4. 风险和待确认问题;
    5. 需要我作出的决定。

    每个阶段结尾必须写:

    “以上为当前阶段结果。请审核;如果没有问题,请回复‘确认’,我再进入下一阶段。”

    当你第一次收到本提示词和工作流图时,不要提前分析尚未发送的剧本,只回复:

    “工作流程已载入。请发送剧本、参考图片、目标成片风格,以及已经确定的视频工具和限制。收到后,我将从第一阶段开始。”

flowchart TD
A[“提供原始剧本与参考资料”] –> B[“明确项目目标<br/>平台、画幅、风格、目标时长、声音、改编尺度”]

B –> C[“提取原作核心<br/>必须保留的情节、人物、台词、气质与留白”]

C –> C1[“估算完整剧本时长与制作成本<br/>核对模型时长、批量能力、参考方式与积分”]
C1 –> C2{“是否全篇生成?”}

C2 — “是” –> D[“可视化适配与节奏规划<br/>叙事节点、注意力曲线、核心段与可选段”]
C2 — “否” –> C3[“选择分期制作<br/>或截取相对完整的剧情片段”]
C3 –> D

D –> E{“改编方案确认?”}
E — “否” –> D
E — “是” –> F[“拆成5—15秒独立视频段<br/>一段对应一次视频生成”]

F –> G[“编写导演镜头脚本<br/>每段继续拆成镜头一、镜头二、镜头三……”]
G –> H[“为每个镜头分配建议持续时长<br/>相加校验段落总时长”]

H –> I{“动作、台词与情绪装得下吗?”}
I — “否” –> J[“压缩动作、调整时长或拆分段落”]
J –> G

I — “是” –> K[“逐段逐镜头技术排错<br/>方向、动作、空间、物理、道具、切镜、台词”]
K –> L{“导演镜头脚本确认并冻结?”}

L — “否” –> M[“只修改问题段落或问题镜头”]
M –> H

L — “是” –> N[“反推并压缩资产清单<br/>角色、服装、场景、关键道具”]
N –> O{“资产来源?”}

O — “已有图片” –> P[“整理现有资产”]
O — “已有成功视频” –> Q[“截取稳定关键帧”]
O — “仍然缺少” –> R[“生成最少必要资产<br/>Work效果不理想时可转聊天模式生成”]

P –> S[“统一资产名称、版本与继承规则”]
Q –> S
R –> S

S –> T{“资产确认并冻结?”}
T — “否” –> N
T — “是” –> U[“将资产绑定到对应段落和镜头”]

U –> U1[“选择连续性或动作风险较高的<br/>一个视频段进行试拍”]
U1 –> U2{“试拍是否通过?”}

U2 — “否” –> U3[“定位并修改受影响的<br/>镜头脚本、资产或提示词”]
U3 –> U1

U2 — “是” –> V[“整合即梦Agent总指令<br/>全局规则+资产绑定+各段独立提示词<br/>禁止Agent改写镜头主体提示词”]

V –> W[“提交前预演检查<br/>独立开始状态、剪辑连续性、资产、台词、声音、时长”]
W –> X{“可以提交?”}

X — “否” –> Y[“只修改受影响的提示词或资产映射”]
Y –> V

X — “是” –> Z[“即梦Agent一次提交剩余段落<br/>分配为多个彼此独立的视频生成任务”]

Z –> ZA[“逐段看片并定位问题”]
ZA –> ZB{“问题属于哪一层?”}

ZB — “局部镜头、动作或台词” –> ZC[“删除、缩短、补生成或替换问题镜头<br/>必要时才重生成对应段落”]
ZB — “资产漂移” –> ZD[“强化资产描述或图片引用<br/>重生成受影响段落”]
ZB — “节奏或段落划分” –> ZE[“调整镜头时长、密度或段落划分<br/>重生成受影响段落”]

ZC –> ZA
ZD –> ZA
ZE –> ZA

ZB — “全部通过” –> ZF[“剪辑合并、声音校正<br/>字幕文字与最终成片”]

使用方法

  1. 新建一个 ChatGPT Work 项目。
  2. 选择 GPT-5.6 Sol。
  3. 把上面的启动提示词和完整执行工作流图一起发送。
  4. 再发送剧本、参考图片、目标风格和工具限制。
  5. AI 每次只完成一个阶段。
  6. 没有问题就回复“确认”;有问题就指出需要修改的部分。
  7. 五个阶段全部完成后,再把已经确认的资产和生成提示词交给视频端执行。

这样,人的主要工作就从“亲自处理全部细节”,变成了:

  • 决定方向、审核结果、确认版本,以及在关键节点纠正问题。

结语

AI 叙事短片并不是把剧本复制进生成器,然后等待模型自动完成。

它更像一次小型影视制作:

  • 剧本决定讲什么
  • 导演镜头脚本决定怎样呈现
  • 视觉资产约束人物和世界
  • Agent 负责分发和组织任务
  • 视频模型负责生成素材
  • 剪辑和返修最终决定故事能否成立

这套方法的核心,也不是增加流程的复杂度,而是把复杂工作放到正确的阶段解决。

只想看懂这套方法,记住五个阶段就够了。

真正准备动手时,再使用完整工作流和阶段确认机制:先确定范围,再逐步拆解;先试拍,再批量生成;出现问题时,只修出错的镜头或视频段。

当每个阶段都有明确的输入、输出和确认标准以后,AI 就不再只是一个随机生成画面的工具,而会逐渐成为一套可管理、可审核、可迭代的叙事制作系统。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
教程百科

AI提示词创作第三十八节:如何不用提示词给画面调色? HEX调色法

2026-10-4 9:27:55

教程百科

AI提示词创作第三十九节:告别塑料AI味!两大前景遮挡神技,一键解锁电影感

2026-10-4 10:31:24

❯
搜索