你有没有刷到过抖音的爆火 AI短片《反正也没时间活》?
单条视频破 1 亿的播放量,点赞 1600W+,作者只发了 11 条作品,涨粉就破了百万。

这种 AI 短剧能够出圈,除了视频本身制作精良外,主要还是剧情感人。
现在很多人,都想尝试做 AI 短片,但苦在不会写剧本。
其实第一次尝试,不用做这种太过复杂的 AI 短片,先从无脑 AI 视频开始学起。
等熟悉各种 AI 工具之后,再去尝试写剧本,做更复杂的内容。
比如,最近很火的,各种 AI 复刻真人动作的小短片,就非常适合练手。
我第一次刷到的时候,真没看出来是AI做的。
里面的人跳舞扭腰,那动作妖娆得很,甩手、转身,跟真人动作一模一样。
而且这种AI生成的跳舞小视频,流量普遍都很好,随随便便就几十万点赞,特别容易出爆款。
今天,先教大家如何做这种 AI 复刻视频。
比如,我用王祖贤和张曼玉在《青蛇》中的经典双人浴池片段,迁移到《新世纪福音战士》的明日香和凌波丽身上。

如果纯靠抽卡,想要做 AI 视频复刻还是有难度的,因为动作是能复刻,但生成出来的人物长相、穿着,容易被原视频带跑了。
建议用 LibTV 上线的「深度动作捕捉」。
这个功能可以把参考视频里的深度动态信息单独提出来,直接生成深度视频。

去掉那些容易污染生成结果的视觉特征,比如人物的长相、服装和背景环境,让你用纯粹的运动轨迹去驱动你自己的角色。
而且这个功能是完全免费的,不用消耗任何积分。
体验链接:
进入网页后,上传素材,点击逐帧拉片,下滑到深度动作捕捉,就可以无脑使用这个功能了。
话不多说,我先展示下我的实测成片,然后教大家如何制作。
一、经典片段复刻
第一条视频,就是开头展示的王祖贤和张曼玉在《青蛇》中的经典双人浴池片段复刻。
这次玩个跨次元的,把原片里的动作,迁移到《新世纪福音战士》的明日香和凌波丽身上。

本场戏的双人动作包含大量遮挡和空间关系。两个人很容易出现手臂穿模、身体粘连,或者前后位置突然错乱的问题。
而且《青蛇》原片的光影、服装和人物辨识度都非常强。
如果使用普通的视频参考方式,这些视觉特征很容易一起污染生成结果。
所以,我们打开 LibTV,上传参考视频。然后点逐帧拉片,下滑到深度动作捕捉功能,就可以生成深度视频了。

生成的效果非常丝滑。

然后,增加视频节点,将深度视频和两张人物素材放入节点。
给到如下提示词,就可以生成构图和运镜完全精控的视频了。

这里有一个小建议,跑的过程中发现 Seedance 2.5 对热门角色的敏感度还是挺高的,可能无法直接使用原作的角色图当资产。
大家可以用生图功能重新跑一遍角色,并且在提示词里规避角色名称,用代称写提示词。
如果 Seedance 2.5 审核不太好过,也可以用 LibTV 里的其他模型生成,比如Wan 3.0、MiniMAX H3 等,都挺好用的。

最后再看一下生成结果。
直观的感受就是,原片中的双人站位、身体朝向、转身回望以及相互靠近的动作节奏,基本都被保留了下来,整体效果还不错。
过去制作这种镜头,往往需要反复抽卡,再从多个结果里寻找勉强能用的版本。现在有了深度视频作为中间控制,第一次生成就已经接近可用,后续只需要微调提示词。
这样一来,找到合适的参考片段以后,就能把它沉淀成可重复使用的动态素材。之后更换新的角色,也不必重新摸索整套运动逻辑。
二、艾达王和里昂演一遍《仙剑三》
前面那条主要看基础的站位能否保持。第二条视频,我想测试深度视频遇到连续切镜时,能不能把每个镜头的构图接住。
所以,我选了《仙剑三》里紫萱和徐长卿的一段比较有张力的对手戏。
这一段应该是很多人的白月光,换成两个气质完全不同的角色以后,还能不能保留原来的感觉?我决定让艾达王和里昂来演。

这段表面上没有什么大动作,实际上很考验模型。
演员主要靠眼神和细微的表情推动情绪,镜头还会不断切换两个人的近景。
整体看下来,成片效果还是不错的。两个人的视线基本能够接上,镜头切换也比较自然。尤其是艾达王的反应,很符合她原本神秘又主动的人物气质。
不过里昂的表情还是有一点呆滞。继续丰富提示词能提升角色的表演,大家可以自己去尝试一下。
制作方法和前面逻辑是相似的,先把原片转成深度视频,再接入艾达王和里昂的人物素材,同时把场景改成一间昏暗的酒吧。

因为要切近景,所以给到了很多人物细节参考图。

要替换场景,也一定要给到场景的参考图。

提示词如下。有了深度视频做参考以后,其实不需要再写特别复杂的动作描述,只要交代清楚每张图片对应的人物,再补充新的场景设定就可以了。

这个案例测试下来,我觉得深度视频不只是能把人物站位稳住。很多很难用提示词说清楚的细节动作,现在都可以直接通过参考视频交给模型。
大家还记不记得,前段时间网上经常有人吐槽,AI连“玩手机”都生成不好?
提示词写了半天,人物还是不知道手机应该怎么拿,经常生成雷人的手机外翻画面。

现在这个问题有一个更粗暴的解法了。找一段动作正确的真人视频,把它转成深度视频,再用来控制自己的角色就可以。
三、武打和舞蹈卡点生成
最后,再来看看深度动作捕捉应用最广的一类场景:武打和舞蹈。
这两类视频对动作节奏的要求都很高。只靠提示词生成,模型很容易把整段动作处理成相同的速度。
该快的地方快不起来,该停的时候又停不住,最后看起来就像人物在机械地完成指令。
深度视频能够提供逐帧的运动过程,让生成结果更有重量感,终于 AI 能卡上点了。
这是我用深度视频生成的一段女团舞,人物替换成了《电锯人》里的玛奇玛和帕瓦。

可以看到,左边真人在跳,右边电锯人在跳,动作几乎是同步的。
最意外的不是大动作对得上,而是那些小地方也没丢。下蹲的时候重心先沉下去,上半身有一个轻微的前倾去找平衡,不是那种AI常见的匀速下降。
如果把左边的原片挡住,你大概不会第一时间意识到这是从一段真人舞台直拍里提取出来的东西。
然后我又把卧虎藏龙里的打戏片段丢进去,用深度动作捕捉提取之后,拿邵氏武侠片的风格重新生成。

上面是原片里的对打场景,下面直接变成了邵氏那个年代的质感,人物换了妆造,兵器从青冥剑变成了砍刀,服装变成了邵氏经典的大红大紫。
因为武打戏里的动态比舞蹈更快更密,我本来以为模型会跟不上,但出来的东西很扎实。打斗的力量感、节奏感,全都保持住了。
砍刀挥过去的轨迹是有弧线的,对方闪开之后身体的晃动也会跟着力的方向走。
这种东西你让AI从零生成根本不可能做对,但现在有了深度视频,一切皆有可能。
这两个视频的生成比前面的更简单,替换了人物之后,只需要跟 LibTV 说一句按照深度视频的运动轨迹生成就可以了,模型自己会从里面读出该怎么动。

如果你之前也试过用提示词去控制舞蹈和武打的节奏,应该知道那有多折磨。现在这个问题算是有了一个不那么痛苦的解法。
四、智能剪辑
聊完深度动作捕捉,再顺便说一个我在 LibTV 上刷到的新功能「智能剪辑」。
本来是做深度视频的时候无意间看到的,试完之后觉得不提一下有点可惜。
大家知道我在阿b上做视频已经挺长时间的了。每次做视频,录视频不算难事,剪辑才是真正吃时间的地方。
有些做信息流的朋友,一天要出几十条条口播素材,每条都要手动剪气口,特别希望 AI 能把这块效率提上来。
LibTV 这个功能就是主攻口播剪辑的,能用 AI 自动理解你的素材内容,帮你完成从粗剪到精剪的整套流程,一键剪辑,并且不耗费任何积分。

用起来也很简单。先在画布里添加一个「视频编辑」节点,然后选择「口播视频」,再把拍好的口播素材全部连接进来。
接下来只需要用一句话告诉它你的要求。比如:“帮我去掉素材里的停顿、口水词和重复内容,精剪成一条完整的口播视频。”
提交以后,AI 就会自动整理所有素材,挑出能用的部分并完成剪辑。处理结束后,点击「打开智能剪辑」,就能直接查看成片,也可以进入时间线继续调整。
我生成了几段化妆品口播素材,让它直接帮我剪成一条完整的成片。

拿到素材后,LibTV 先分析了每段视频的类型,把口播 A-roll 和 B-roll 分开处理。
接着提取口播的逐字稿,同时理解其他素材的画面内容,为后面删除停顿和自动匹配插入镜头做准备。

很快,LibTV 就给到了一版 A-roll 的粗剪。
它不仅会剪辑口水词和气口,还逐段找出了片头片尾的静音,依照逻辑进行裁切。

等到我确认 A-roll 口播内容无误后,它开始插入 B-roll 的内容,给出了一份清晰的画面清单。
每条素材从第几秒开始,应该挂在哪句台词下面,都标得很清楚。
它还会判断素材和口播内容的关联强度,方便后面检查和调整。

很明显,视频已经形成了一条完整的带货逻辑。还有一些花字特效。
虽然目前视觉效果还比较弱,不过对于一个初版的口播稿,已经够用了。
大大节省了后期剪辑的成本。
五、总结
OK,今天教了一些 LibTV 的实用小技巧。
这些 AI 视频工具学会使用之后,下一步就可以学着写各种剧本,做一些更有难度的 AI 短片。
希望这些内容对你想做 AI 短片,有所帮助,我们下期再见~