ComfyUI 从安装入门到精通,LTX-2 在 4060 8G 上跑 AI视频(低显存也能出视频)

ComfyUI 从安装入门到精通,LTX-2 在 4060 8G 上跑 AI视频(低显存也能出视频)

前面十三篇走下来,你已经有了一整套静态图的本事——装机、出图、调质量、放大、锁脸全齐活。但有个事我一直压着没讲,因为它最容易劝退 8G 卡用户:视频

我得说实话,自己第一次想碰视频时心态是”算了,8G 卡别想了”。头脑一热下了个好几十 G 的大模型,一点 Queue 直接 out of memory。后来才知道,不是 8G 不能玩,是我用错了模型、也没量化。现在 LTX-2 这个开源视频模型,靠蒸馏版 + GGUF 量化,咱们 4060 8G 真能出视频,就是得守一套低显存打法。这篇把它讲透。

一、LTX-2 是啥,和出图有啥不一样

一句话:LTX-2 是个开源的”文生视频 / 图生视频”模型,你写一句话(或丢一张图),它给你吐出一段会动的短片。出图是”一帧”,视频是”一串帧连起来动”。视频比出图重得多——一段 49 帧的视频等于要把类似过程重复 49 次还带前后帧关联,所以特别挑显存。

一句话记住:视频 = 很多帧 + 帧与帧之间的连贯,所以它比出图吃显存,但思路还是”模型 + 提示词 + 采样”那一套。

两条主要玩法:
· 文生视频(T2V):写提示词,凭空生成一段视频。
· 图生视频(I2V):丢一张静态图当”首帧”,让图里的东西动起来(小人走、云飘、人眨眼)。

二、模型和插件放哪(放错下拉框永远空)

先说装东西,这步坑最多。LTX-2 在 ComfyUI 里不是自带节点,要装自定义节点包 + 量化模型。

第一步:装自定义节点(都在 ComfyUI Manager 里搜得到)
· ComfyUI-LTXVideo:核心节点包,没有它就没有 LTX 节点。
· ComfyUI-GGUF:用来加载 .gguf 量化模型。
· ComfyUI-KJNodes:视频 VAE 辅助节点。
· ComfyUI-VideoHelperSuite:视频读写、帧工具。

踩坑经历:我头回只装了 LTXVideo,加载工作流满屏红节点”missing”。其实是 GGUF 和 VideoHelperSuite 没装,LTX 节点依赖它们。装齐重启,红节点全消。

第二步:下模型,按固定目录平铺放

ComfyUI/models/unet/    → ltx-2-19b-distilled_Q3_K_M.gguf
ComfyUI/models/text_encoders/ → gemma-3-12b-it-qat-Q2_K.gguf
ltx-2-19b-dev_embeddings_connectors.safetensors
ComfyUI/models/vae/    → LTX2_video_vae_bf16.safetensors(或 ltx-2-19b-dev_video_vae.safetensors)

模型去 Hugging Face / Civitai 的 LTX-2 专区下,全免费。

踩坑经历:下完模型下拉框刷不出来——老毛病了,F5 刷新网页就好。和放 LoRA、放放大模型一模一样的坑,我又栽了一次,你别学我。

三、手把手接节点(原理式,讲怎么接)

LTX-2 的节点链长这样(端口我查了官方文档和社区实测核对):

Load LTX Model → CFGGuider(配正负提示词) → guider
LTXVScheduler → sigmas | KSamplerSelect(euler) → sampler | RandomNoise → noise
EmptyLTXVLatentVideo + LTXVEmptyLatentAudio → LTXVConcatAVLatent → av_latent
SamplerCustomAdvanced(noise+guider+sampler+sigmas+av_latent) → 输出 AV latent
→ LTXVSeparateAVLatent(拆出 video latent) → VAEDecode → 画面
→ VHS_VideoCombine(画面+音频) → mp4
DualCLIPLoader(GGUF, type=ltxv) → CLIP Text Encode(±) → Positive / Negative

端口怎么接(这步是重灾区):
· DualCLIPLoader(GGUF) 的黄色 CLIP 口 → 正负提示词节点的 clip 口。
· 关键坑:type 必须手动设成 ltxv。默认可能是 sd3,不改出来的视频满屏静态雪花、一帧都不动。我第一次就栽在这,重下两遍还是雪花,折腾一晚上。
· 模型不直接进采样器:Load LTX Model 的 MODEL 口 → CFGGuider 的 model 口;CFGGuider 再吃 Positive / Negative,输出 guider → 接 SamplerCustomAdvanced 的 guider 口(它压根没有 model 口,这是和老版 KSampler 最大区别)。
· LTXVScheduler 的 SIGMAS → SamplerCustomAdvanced 的 sigmas 口。
· SamplerCustomAdvanced 还吃 noise(RandomNoise)和 latent_image(上面的 av_latent)两个口;noise + guider + sampler + sigmas + latent_image 五个口喂满才出 latent。
· 采样器输出的是 AV latent(视频+音频打包),必须先过 LTXVSeparateAVLatent 拆出 video latent,再送 VAEDecode;直接喂 AV latent 给 VAE 解码会报错。
· VAE 解码出的画面 + 音频 → VHS_VideoCombine(导出 mp4)。

图生视频(I2V)额外一步:加 Load Image → LTXV Img To Video Inplace(内置节点,类 LTXVImgToVideoInplace)。它把图片编码进 latent 首帧(vae+image+latent → latent),接在采样前的 latent 链上(和 EmptyLTXVLatentVideo 出来的 latent 汇合进 LTXVConcatAVLatent),视频第一帧锁死你那张图。注意它输出的是 latent、不是 model,别把它当模型节点用。

一句话记接法:文本走 GGUF 双 CLIP(type 设 ltxv)→ 模型+提示词进 CFGGuider 变 guider → 调度器给 sigmas → 采样器出 AV latent → LTXVSeparateAVLatent 拆出 video latent → VAE 解码 → VideoCombine 存盘。

实操闭环:10 分钟,出一段 2 秒小狗视频(现在就做)

前面讲原理,这段真做一遍。做完你手里多一段”会动的小狗”,还能亲眼确认 8G 卡确实能跑视频。

前提:你已装好 ComfyUI + 上面四个节点包,模型按第二节放进了对应目录。
目标:用蒸馏版出一段约 2 秒(49 帧)的小狗在花园跑的 512×288 视频。

步骤(照着点,别跳):
1. 下模型:unet 用 ltx-2-19b-distilled_Q3_K_M.gguf,文本编码器放 text_encoders/(gemma qat Q2 + connector),vae 用 LTX2_video_vae_bf16,按第二节目录放好,F5 刷新。
2. 装节点:Manager 搜 ComfyUI-LTXVideo / GGUF / KJNodes / VideoHelperSuite,装完重启。
3. 加载范式工作流:节点包带 example_workflows/video_ltx2_t2v_distilled.json(蒸馏版 8 步),File → Load 导入,能少接很多线。
4. 设双 CLIP:加 DualCLIPLoader(GGUF),clip_name1 选 gemma Q2、clip_name2 选 connector、type 手动改成 ltxv(保命一步)。
5. 设尺寸帧数:宽 512、高 288、帧数 49(公式 (8×N)+1)、帧率 24。
6. 设采样:Steps 用蒸馏固定 8,CFG 设 1.0(蒸馏版固定值,全模型才用 5~6)。
7. 写提示词:A golden retriever puppy playing in a sunny garden, wagging its tail. Slow camera pan.
8. 出视频:Queue Prompt,等几分钟,VHS_VideoCombine 吐出 mp4。

检查点(你跑完应该看到):① 出了一段 mp4,小狗在花园里动起来,约 2 秒;② 满屏静态雪花不动 = type 没设 ltxv,回步骤 4;③ 全黑 / 绿屏 = 模型文件名或 dtype 不对,核对目录;④ 直接 OOM = 分辨率或帧数太大,降到 41 帧 480×270。

作业(选做):同一段提示词,一次 Steps 8(蒸馏),一次 Steps 25(全模型),对比”快但略糙”和”慢但更顺”的差别。

四、核心旋钮 / 参数详解

旋钮
甜区 / 默认
说明
帧数
(8×N)+1,常用 49/61/81
49 帧≈2 秒@24fps;上限 193;4060 用 49~61
分辨率
草稿 512×288,4060 上限 640×384
最短边≤512 先出小样
Steps
蒸馏固定 8;全模型 18-34
低于 18 运动连贯性掉
CFG
蒸馏固定 1.0;全模型 4.5~6.5
蒸馏版 CFG=1.0;全模型太高边缘闪
帧率
24fps
VHS_VideoCombine 里设

踩坑经历:我有一回用全模型把 CFG 拉到 8 想”更听话”,结果视频边缘一圈光晕、纹理狂闪。降到 5.5 立刻正常。而蒸馏版反过来要设 1.0——两条线的 CFG 别搞混。

五、4060 / 8G 专项:诚实说,是”勉强能跑”

先泼盆冷水,别被标题带跑:4060 的 8G 跑 LTX-2 是”勉强能跑”,不是丝滑 1080p。多源实测结论很一致——8G 卡必须量化 + 低分辨率 + 少帧,出的是几秒低清短片段。这是我特意查证过的,不忽悠你。

· 必量化:unet 用 Q3_K_M(GGUF 文件约 10.3G,配低显存模式勉强塞进 8G),或上 FP8 蒸馏版;Q4_0 文件约 10G、显存 11-12G,8G 卡很悬,建议留余量选 Q3_K_M。文本编码器死守 Q2_K(约 4G,认准 qat 仓库)。
· 尺寸锁死:512×288 起步,顶多 640×384;最短边别超 512 出草稿。
· 帧数克制:49~61 帧(约 2-2.5 秒),想更长就双阶段放大。
· 开显存优化:跑前设环境变量 PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True,少崩很多。
· 耐心等:512×288 / 49 帧一轮大概几分钟。

我踩过的坑一次说全:① 头回下大模型直接 OOM,误以为 8G 和视频无缘;② type 没设 ltxv,满屏雪花重下两遍;③ CFG 拉到 8 边缘狂闪光晕;④ 帧数设 243 直接崩;⑤ 没开显存优化变量,跑大点就 OOM。

跑不动的退路(诚实交代):如果极限设置你的 8G 还是崩,三个出路——① 借云端 GPU(按小时计费,几分钟搞定一段);② 等更小的视频模型;③ 退回 LTX 旧版(更早更小,显存门槛低)。别硬扛,8G 有 8G 的玩法。

六、参数速查表(照着抄)

场景
模型档
分辨率
帧数
Steps
CFG
4060 快速试水
distilled Q3
512×288
49
8
1.0
4060 稍好画质
distilled Q3
640×384
61
8
1.0
12G 卡常规
Q4_K_M
768×432
81
24-28
5.5
16G+ 全模型
Q5_K_M / FP16
1024×576
97
28-34
5.5
图生视频 I2V
distilled Q3
512×288
49
8
1.0

七、常见坑 / 雷区

· 静态雪花不动:DualCLIPLoader 的 type 没改 ltxv,回第三节步骤 4。
· 全黑 / 绿屏:模型文件名或 dtype 错,核对 unet / text_encoders / vae 三件套(尤其 gemma 要用 qat 仓库的)。
· OOM 爆显存:分辨率或帧数太大,4060 先锁 512×288 / 49 帧。
· 视频很糙、动作卡:Steps 太低(蒸馏 8 够,全模型别低于 18)。
· 提示词被无视:CFG 太低(<3),拉回 5.5 左右。
· 帧数设成 243:超出上限直接崩,严守 (8×N)+1。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
教程百科

ComfyUI 从安装入门到精通,高清放大,把小图拉到海报级

2026-8-22 9:12:32

资讯

Meta 推出 Vibes 短视频应用,平台所有内容均为 AI 生成

2025-9-28 11:29:08

搜索