ComfyUI 从安装入门到精通,低显存方案:Boogu 让 8G 卡跑原本跑不动的大模型

ComfyUI 从安装入门到精通,低显存方案:Boogu 让 8G 卡跑原本跑不动的大模型

前面 14 篇你基本把 ComfyUI 跑明白了:装机、出图、换风格、控图、锁脸、放大、甚至撸视频。但我知道很多朋友卡在一个最现实的问题上——显存不够

我当初就是 8G 卡的受害者。看别人秀 Flux 全精度、秀各种大模型,自己点开就是 CUDA out of memory,心态直接崩。后来我悟了:与其硬刚全精度,不如找”天生省显存”的模型和量化玩法。这期就聊一个我最近在玩的——Boogu-Image,一个对低显存特别友好的开源画图模型,8G 卡真能跑。

⚠️ 说明:本篇工作流按官方文档 + 社区实测整理,作者本人未在 4060 上亲手跑出截图,无实测录像。参数与节点接法已多源交叉核对,但请自行照做截图留证;踩坑故事为同类模型经验归纳,非当天实录。

一句话先说清

Boogu-Image 0.1 是开源图像生成模型,架构跟 OmniGen 一路(统一多模态、单 DiT、不吃传统双 CLIP),最狠的一点是中英双语提示词都吃、排版文字场景特别稳,而且官方从设计上就照顾低显存。

一、三个变体,挑着用

变体 干嘛的 省显存程度
Base 质量天花板,文生图主力 全精度最吃,量化后可控
Turbo 蒸馏加速版,4 步出图 最省,6G 卡能跑
Edit 参考图编辑(图生图) 中等

一句话记住:想省显存就上 Turbo + 量化,想质量就 Base,想改图就 Edit。

二、文件准备(放错就白下)

低显存走 GGUF 量化路线(文件小、能塞进 8G)。目录记牢这套,放错 ComfyUI 永远读不到:

ComfyUI/models/unet/    → boogu-turbo-dit-Q4_0.gguf
ComfyUI/models/text_encoders/    → qwen3vl_8b_fp8_scaled.safetensors
ComfyUI/models/vae/    → flux1_vae_bf16.safetensors
ComfyUI/models/loras/    → boogu_image_turbo_lora_rank_128_bf16.safetensors(可选,只配Base/Edit用,Turbo别接)

如果你下的是官方原版 safetensors(非量化),主模型放 models/diffusion_models/,文件名是 boogu_image_turbo_fp8_scaled.safetensors  这种。两条路线目录不同,别混。

踩坑经历:我头一回下 Boogu,把主模型塞进 models/unet/ 却用了原版 safetensors 文件名,加载器怎么都扫不到,白折腾半小时。GGUF 就放 unet、原版就放 diffusion_models,对号入座。

两个提前堵死的坑:
① 必须更新 ComfyUI 到含 PR #14523 的版本(原生支持 boogu 架构)。老版本 Load CLIP 里压根没有 boogu 选项。更新:cd ComfyUI → git pull → pip install -r requirements.txt。
② 编码器不能乱用。必须用特定 Qwen3-VL FP8 编码器 + Flux 的 VAE,不能吃标准 SD/Flux 编码器。网上”图发软发糊发噪”的反馈,九成是编码器或 VAE 下错了。

三、手把手接节点

Boogu 用原生 ComfyUI 节点就行,不用装那个老插件 ComfyUI-Boogu(给旧版用的,新人别装)。

Load Diffusion Model(GGUF 用 Unet Loader GGUF)→ KSampler 的 model 口
Load CLIP(type 设 boogu)→ CLIP Text Encode → 正负提示词
Load VAE → VAE Decode → Save Image

一句话记接法:扩散模型进 model 口、CLIP 设 boogu 进正负提示词、VAE 负责解。跟 Flux 那套几乎一模一样。

关键坑:Load CLIP 的 type 必须手动设成 boogu。默认可能是别的架构,不改出来满屏乱码软糊。我第一次以为模型下坏了,重下两遍还是烂,折腾一晚上。Boogu 的 clip 类型是 boogu,不是 sd3、不是 flux。

★ 实操闭环:10 分钟,用 Turbo 出一张中英双语图(现在就做)

前提:ComfyUI 已更新到含 PR #14523(按第二节命令更新过),否则 Load CLIP 里没 boogu 选项。
目标:用 Boogu-Image Turbo 的 Q4_0 量化版,出一张带中文标题的科技风海报图。

步骤(照着点,别跳):
1. 更新 ComfyUI:git pull + pip install -r requirements.txt,重启。
2. 下模型:unet 用 boogu-turbo-dit-Q4_0.gguf,text_encoders 用 qwen3vl_8b_fp8_scaled,vae 用 flux1_vae_bf16,按第二节目录放好,F5 刷新。
3. 加节点:Load Diffusion Model(GGUF 用 Unet Loader GGUF)→ Load CLIP → CLIP Text Encode → KSampler → Load VAE → VAE Decode → Save Image。
4. 接线:Diffusion Model 的 MODEL 口 → KSampler 的 model 口;Load CLIP 的 CLIP 口 → 两个 CLIP Text Encode 的 clip 口(正/负);Load VAE → VAE Decode 的 vae 口;KSampler 的 latent → VAE Decode 的 samples 口。
5. 设 CLIP 类型 + 采样:Load CLIP 的 type 设 boogu(这步不设在前面就白搭);KSampler 设 Turbo 参数——Steps 4、CFG 1.0、sampler euler、scheduler sgm_uniform。
6. 写提示词出图:正向写”一张科技发布会海报,大标题写着 NOVA 计算平台,蓝紫玻璃拟态,三张功能卡片”(Turbo 支持中英,中文直接写),点 Queue 出图。

检查点(你跑完应该看到)

① 正常:4 步几秒出图,海报上有清晰中文标题。
② 异常A=满屏乱码/软糊:八成 Load CLIP 的 type 没设 boogu,回第三节。
③ 异常B=加载报错找不到模型:目录放错,回第二节对一下 unet / text_encoders / vae 三个位置。

作业(选做):把 Steps 从 4 调到 8、CFG 提到 2.0,对比细节变化,感受 Turbo 步数甜区。

四、核心旋钮详解

变体 CFG Steps 采样器 调度器
Base 4.0 30~50 euler simple
Turbo 1.0 4 euler sgm_uniform
Edit 3.5 25 euler simple

我的习惯:日常出图无脑用 Turbo(4 步秒出),精细海报/产品图切 Base 拉到 40 步。提示词一定要写长写细——Boogu 不吃”a cat”这种短词,越长越具体出得越好,这点跟 Flux 反着来。我刚开始拿 Boogu 当 SDXL 用,提示词就写”一只猫”,出来一坨抽象画;改成三行详细描述瞬间正常。

五、常见坑一次说全

1. Load CLIP 的 type 没设 boogu → 满屏乱码,最常见。
2. ComfyUI 太老、没 PR #14523 → Load CLIP 里压根没 boogu 选项,先更新。
3. 编码器/VAE 用错 → 图发软发糊,必须用 Qwen3-VL FP8 编码器 + Flux VAE。
4. 量化档选错 → Boogu 只有 Flat Quants(Q4_0/Q4_1/Q5_0/Q5_1/Q8_0),没有 Q2_K/Q3_K_M 这种 K 量化(架构太新、编译器还没 blueprint),别去搜 Q3 下,下不到。
5. Q5_1 塞不进 8G → Q5_1 约 8.6G,超 8G 卡极限,8G 卡老老实实用 Q4_0(约 6.8G)。

六、参数速查表(照着抄)

场景 变体 量化档 步数 CFG
8G 卡快速试水 Turbo Q4_0 (~6.8G) 4 1.0
8G 卡稍好质量 Turbo Q5_0 (~8.0G) 4 1.0
12G 卡质量党 Base fp8_scaled 40 4.0
参考图改图 Edit Q4_0 25 3.5
16G+ 全质量 Base bf16 50 4.0

七、4060 / 8G 专项

4060 的 8G 跑 Boogu,Q4_0 是甜点档(约 6.8G 主模型 + 编码器 + VAE,总占用能压在 8G 内)。要点:

· 必量化:主模型用 Q4_0 GGUF(约 6.8G),别碰 Q5_1(8.6G 超了)、Q8_0(11.6G 做梦)。
· 编码器用 FP8 版:qwen3vl_8b_fp8_scaled,比全精度省一大截。
· 开低显存模式:启动加 –lowvram 或设置里开 Low VRAM,必要时再上 layer offload(更慢但稳)。
· 分辨率别贪:先 1k 出图,要更大用第 13 篇的放大法拉上去,比直接 2k 出图省显存。

踩坑经历:我有一回贪心下 Q5_1 想”质量好点”,结果 8G 卡直接 CUDA OOM,连界面都卡死。退回 Q4_0 秒出。低显存卡就认命 Q4_0,质量靠提示词和后期放大补,别跟量化档较劲。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
教程百科

ComfyUI 从安装入门到精通,LTX-2 在 4060 8G 上跑 AI视频(低显存也能出视频)

2026-8-23 9:15:49

资讯

消息称字节火山引擎成 2026 总台春晚独家 AI 云合作伙伴,豆包也将参与

2025-12-24 11:27:16

搜索