最近在抖音上刷到一条爆火的卡点视频,很有节奏感。找不到原片了,大概是这种。

然后就想替换其中的人物复刻一个类似的视频。
网上很多复刻失败,并不是人物不够好看,而是走位、重心、镜头距离和遮挡关系没对上。
我们只保留爆款视频的动作和空间结构,再换成自己的角色:先用 Codex 把动作抽象成深度视频,再在 LibTV 中完成人物替换。
深度视频+人物三视图工作流
- 深度视频是一种包含场景深度信息的视频类型,通过记录每个像素到摄像机的距离,实现比传统二维视频更真实、立体的视觉体验。
- 人物三视图则是通过完整展现人物角色正面,侧面,背面三个不同视角。
而我的整个制作流程就是基于深度视频来生成的。
深度视频负责“动作与空间”,人物三视图负责“长相与服装”,两者配合比只上传原视频稳定。不过它不是万能钥匙:脸和服装的一致性仍取决于人物参考图,复杂手指也可能出错。

一、让 Codex 生成深度视频
我把原视频交给 Codex,核心指令只有这一段:
- 请把这个视频转换成深度视频
Codex 先读取视频参数:6.25 秒、1080×1920、60fps,共 371 帧。随后自动创建 Python 环境,安装 OpenCV、NumPy、ONNX Runtime DirectML,调用 FFmpeg 编码,并下载约 99MB 的模型。整个过程不需要我手写代码。咱们知道一下就行。

最终我们得到如下一个深度视频:

Tips:原则上你用任何Agent都可以的,不管的WorkBuddy,ZCode,Trae或其它Agent,都是可以生成深度视频,主要是调用你的本地程序和显卡。
二、Codex用的是什么算法
核心模型是 Depth Anything V2 的 ViT-Small,约 2480 万参数。它对每帧做单目相对深度估计:离镜头近的区域更白,远处更黑。
单纯逐帧处理容易闪烁,所以脚本又做了三步:用 2%—98% 分位数统一灰度范围;平滑相邻帧的深度区间;静止区域更多继承上一帧,运动边缘优先采用当前帧。最后放大回原分辨率,以 H.264、CRF 10、无音频方式输出。

三、显卡要求和实际耗时
生成深度视频对于电脑的显卡是有一定要求的。
我的电脑是 RTX 3060 Laptop 6GB,处理器是 i7-12700H,推理走 DirectML。
根据文件时间记录:首次配置环境、下载模型到成片约 12 分钟;真正处理 371 帧用了约 2 分 23 秒。
经验上,ViT-Small 处理这种 6—10 秒短视频,4GB 显存可以尝试,6GB 比较够用;想换更大的 Base/Large 模型或处理长视频,建议 8GB 以上。
没有独显也能跑 CPU,只是会慢很多。这些是实测经验,不是算法的硬性门槛。

四、生成人物三视图
这个比较简单,提供一张人物的近身图片,上传给生图大模型,让它生成人物三视图即可,可以使用下面的指令:
- 参考上传图片的人物形象,采用近照特写和三视图参考布局,背景为干净白色背景。左侧为人物近照特写,右侧为人物三视图,包含全身视图:前视图、左侧视图和后视图,均为双手在侧的中性站立姿势。服装保持整体气质的前提下,发饰和服装调整的简约一些,人物五官装扮保持不变,画面上除了人物不出现其它场景,文字,logo等不相关内容。整体风格是清晰、高分辨率的写实渲染照片,而不是插图。每个视图独立生成一张图片,每张图片比例均为9:16
这样我们就可以得到这样一张人物三视图。

五、在 LibTV 里完成人物替换
深度视频完成后,我们打开LibTV同时上传:
- 同一人物近照+三视图图片;
- 处理好的深度视频。

提示词可以直接写:
- 以提供的黑白深度视频作为深度引导参考 {{Mixed 2}} ,严格遵循深度视频中的空间纵深,人物姿态,镜头移动轨迹,画面结构;将深度视频中的人物替换为指定角色 {{Mixed 1}} 的五官和服装装扮,去掉黑色小肩包,
- 将深度视频抽象结构转化为超写实人物短片,高调纯白无缝摄影棚场景,背景和地面均为干净纯白,无任何家具、凳子、电线、摄影器材或其他杂物。还原真实的环境材质,自然光影,人物动作,场景布局和提供的深度视频保持一致,画面流畅无崩坏,持续匹配深度信息不偏移,角色形象保持统一。
这样生成后,原爆款视频的动作、走位和推进关系被保留下来,人物则替换成了三视图里的新角色。

六、还有哪些方案
最近LibTV也上线了深度动作捕捉,如果你没有显卡,或者觉得电脑生成的慢,你就可以在这上面快速生成,免费的哦。

不过我测试了一下,发现它的精度没有我本地显卡的精度高,不过动作引导没什么问题。

这套工作流的核心就是针对爆款视频的动作、机位和空间关系进行处理,深度视频能显著提高人物替换的复刻度;如果核心是台词、剪辑或情绪表演,它的帮助就有限。