上一期和大家分享了我接触和尝试使用ai视频,深入了解ai短剧这一行业。我花了三个月,终于弄明白了怎么用AI短剧赚钱。
这段时间 AI 视频工具迭代得特别快,从单一生成平台到能跑通全流程的智能体平台,玩法一直在变。但核心逻辑其实没变:工具只是辅助,找对方法、少走弯路,普通人也能上手。

近期正好给甲方做一个玄幻穿越的西游记版本剧情片,两个人两天高强度生成画面,前后一共差不多花了1500元,分别使用了LibTV和Running hub两个平台。接下来我会无保留地和大家分享一下ai短片制作的完整流程,新手小白也可以上手尝试的那种。
文章包含以下几个部分:
1.目前一共有哪些智能体创作平台?选择哪个平台最好?用哪个大模型效果更好?
2.ai短片的完整操作流程是怎么样的?
3.ai生成视频的提示词怎么写?不满意的话如何调整?
4.需要注意的雷点和避坑小分享
1.主流 AI 智能体创作平台怎么选?

现在市面上能做全流程 AI 短片的智能体平台不少,主流的就是 LibTV、Running hub、TapNow、Shotlab 这四个。它们底层逻辑都是节点式画布创作,学会一个就能快速上手其他的,核心差异在价格、模型满血度、功能侧重,对应不同的预算和需求。
四个核心平台横向对比
LibTV:它是 LiblibAI 旗下的平台,性价比高,积分价格相对划算,对新手比较友好。自带3D导演台功能,可以在虚拟空间里调整人物站位和机位,能在一定程度上缓解人物比例失调、空间关系混乱的问题,用于多人物的对话和运动。平台里有不少创作者分享的现成工作流,适合刚入门、想低成本试水的朋友。
Running hub:有一定基础后,适合熟悉工作流、有定制需求的创作者或小团队。支持API调用,可以把自己调试好的工作流部署上去,按次消耗积分,不用一直挂机等。更新速度比较快,支持更高清的画质输出,也能对接 PS 等设计工具,做商业定制、高品质短片的时候效率会更高。像一些难以实现的镜头更擅长。
TapNow:业内比较早做节点式画布的平台,专门针对影视创作者设计,功能全、运行稳。对于角色人物和服饰道具上的选择丰富,社区里有很多现成的工作流模板,替换素材就能批量出片。缺点是会员和积分价格偏高,新手试水的话积分消耗会比较快。另外它对三维空间的感知弱一些,复杂的多人互动镜头,需要多调几次提示词。
Shotlab:新片场旗下推出的 AI 创作平台,它最大的优势是背靠新片场十几年的创作生态,一方面整合了 Seedance、可灵、Midjourney 等主流模型;另一方面平台社区里有大量成熟创作者公开的画布工作流,可以直接参考复用,新手入门很快。另外它支持多人在线协作,对小团队比较友好,创作完成后还能直接同步到新片场社区,有机会接触到商单资源。缺点是对真人出镜的内容有合规审核限制,纯写实真人题材的自由度会稍低一些。
大模型怎么选?
目前主流常用的视频生成模型各有侧重,没有全能的 “最优解”,根据镜头类型搭配着用,既能保证效果,也能控制成本。
- 即梦:剧情类镜头首选人物动作自然、面部表情细节表现较好,口型匹配度相对高,还能同步生成环境音效。做剧情类、人物对话多的片段,可用率会更高,是目前做剧情短片的主力模型。

- Veo3:高品质商单、电影质感首选谷歌 DeepMind 推出的模型,最大优势是接近广播级的画面质感、符合物理逻辑的专业光影色彩,原生音画同步能力很强,对话、环境音效可以一步生成,支持原生高分辨率输出。适合对画质、质感要求高的商业定制片、概念短片。缺点是生成成本偏高,单条消耗积分多,适合定稿的关键镜头使用,不适合批量试错。
- 可灵:写实题材、高一致性首选快手自研的国产模型,最突出的优势是主体一致性强,上传多角度参考图后,人物、场景在不同镜头间的稳定度很高,照片级写实质感也很出色。做真人风格、连续剧情的段落很适配,性价比也不错,是目前国产模型里实用性很强的选择。
- Happy Horse:空镜、大场景性价比之选环境氛围和光影渲染效果不错,写实质感强,适合做风景空镜、场景过渡镜头。缺点是人物细节表现一般,原生音效能力弱,用来做辅助镜头成本很低,性价比高。

具体规格怎么选择?
很多新手一上来就选 1080p,结果积分哗哗掉,效果还不一定好。目前对提示词响应最稳定、出错率最低的是 720p,画面色彩和人物轮廓都清晰,只是细节略有柔化;1080p 质感确实更好,但积分消耗是成倍增长的,而且很容易出现画面崩坏。更高效的做法是:先用 720p 批量生成镜头,选到满意的成片后,再用 Topaz 这类工具统一放大到 4K。另外尽量按「镜头组」生成,不要一镜一镜单独生成,既能减少人物前后不一致的问题,也能省下不少积分。

2.AI 短片完整制作流程:
很多新手做 AI 视频,上来就直接输文字生成视频,结果十有八九翻车。正确的流程是先定资产,再做视频,前期铺垫越细,后期返工越少。
01.灵感与故事构建
先把核心要素全部敲定:人物设定、场景风格、剧情走向、核心台词,一个都不能含糊。写的时候尽量按分镜头的逻辑去写,哪个场景发生什么事、出现什么人物、说什么台词,都梳理清楚。后面生成视频的时候,可以直接拆分使用,省掉二次整理的时间。(实在没有灵感也可以根据图片在平台上直接和ai助手沟通,让它帮忙编写剧情和细化内容,没准在沟通的过程当中可以激发出灵感)

AI创作的下限是工具,上限永远是故事本身。 别把精力全放在研究工具上,把剧情和逻辑捋顺,片子才会好看。
02.拆分分镜头脚本
如果写的是完整剧情稿,可以拆成「镜头组」。把同一个场景里发生的剧情归为一组,标注清楚每个镜头的景别、人物动作、台词内容。不用很精致,把信息列明白就行,这是后面生成视频的核心依据。很多人花大量时间做华丽的分镜故事板,带运镜曲线、带专业标注,最后丢进 AI 里反而错漏百出,完全没必要。

03.注意的雷点和避坑小分享场景图、分镜图
这是保证视频一致性最关键的一步,绝对不能省
文生图、图生图:可以通过喂参考图或提示词描述来不断优化,尽可能将生成的图片完善至最终要的效果


工具:Mj、nanobanara、image
- 人物角色图:尽可能完整地将人物的主体设定、样貌细节、服饰配饰、道具等描述明确。生成面部特写 + 正面 / 侧面 / 背面全身三视图。固定好人物形象,后续生成视频直接 @参考图,能最大程度避免人物变脸、服饰穿帮。顺便提一句,用这类智能体平台生成人物,可以绕开即梦、可灵等平台对真人人脸的限制,自由度更高。

2.场景四视图:重要场景最好生成四个角度的视图,再补几张局部细节图,固定好场景的整体风格和布局。如果需要人物站位,也可以生成一张带人物的场景示意图,提前定好人物和环境的比例,避免生成的人物忽大忽小。

3.分镜参考图:关键镜头可以先生成分镜静帧图,构图、光影、人物位置都调整到最佳状态,再拿去生成视频,成功率会高很多。

4.视频生成
素材准备就绪,就可以进入核心的视频生成环节了。提示词不用写长篇大论,核心抓五大要素,精准描述就够了:
- 主体:直接 @提前做好的角色图,不用再用文字重复描述长相;
- 场景:@对应的场景参考图,需要明确站位就用带人物的场景图;
- 镜头:写清楚景别(特写 / 中景 / 全景)、拍摄角度、运镜方式,以及画面里发生的具体动作、台词内容;
- 风格:明确视频整体风格(2D动漫/3D动画/定格动画/CG/真人写实电影),可以补充电影机型、光影风格、色调参考;
- 要求:务必加上「无背景音乐,仅保留音效」。AI 自带的 BGM 会严重干扰后期剪辑配乐,一定要提前规避。配音建议统一用同一款 AI 音色提前生成好,或者上传真人配音,避免前后声音不一致。


5.抽卡优化提示词
一次生成就完美的情况少之又少,不满意是常态。调整有三个实用技巧:
- 效果差一点的,直接复制节点,微调提示词(比如补充动作细节、调整运镜速度),重新生成;
- 完全不符合预期的,回头优化分镜参考图,用更精准的静帧图引导生成;
- 短剧情优先生成 15 秒的镜头组,给 AI 更大的发挥空间,连贯性反而比单镜头更好。
6.剪辑成片
把所有生成好的镜头素材导出,按剧情顺序剪辑拼接,配上统一的配音、BGM 和字幕,做简单的转场过渡,一条完整的 AI 短片就完成了。ai短片对于音乐和音效的要求会高一点,还有节奏上也是要做到有起伏。

3.注意的雷点和避坑小分享

不用做精致的分镜故事板
很多人花十几分钟做带运镜曲线、专业标注的华丽故事板,以为越详细 AI 生成得越好,结果恰恰相反。过度复杂的标注反而会干扰 AI 的判断,错漏百出。分镜只要把「场景、人物、动作、景别」四个信息说清楚就足够了,形式越简单,执行越高效。
提示词不是越长越好
别用 AI 生成一大段华丽的提示词,里面全是情绪渲染和冗余描述。既然已经上传了主体和场景参考图,就不用再用文字重复描述长相和环境,直接 @图片就行。提示词越精准、越聚焦动作和镜头,AI 的执行效果越好。少即是多,在 AI 提示词里永远成立。
不要频繁切换模型
同一个镜头,别换着模型反复试。不同模型的画风、色调差异很大,最后剪到一起会非常割裂。固定好搭配,保持整体风格统一,比追求单个镜头的惊艳更重要。
写在最后:
以前做一条短片,要写脚本、找演员、拍素材、做后期,动辄几周起步;现在两个人几天时间,就能输出完整的成片。工具在迭代,创作的门槛在降低,但真正决定内容好坏的,依然是想法和审美。
如果你也对 AI 短片感兴趣,找一个简单的小故事,照着流程试着做第一条。哪怕只有十几秒,也是从零到一的开始。