
前面 14 篇你基本把 ComfyUI 跑明白了:装机、出图、换风格、控图、锁脸、放大、甚至撸视频。但我知道很多朋友卡在一个最现实的问题上——显存不够。
我当初就是 8G 卡的受害者。看别人秀 Flux 全精度、秀各种大模型,自己点开就是 CUDA out of memory,心态直接崩。后来我悟了:与其硬刚全精度,不如找”天生省显存”的模型和量化玩法。这期就聊一个我最近在玩的——Boogu-Image,一个对低显存特别友好的开源画图模型,8G 卡真能跑。
⚠️ 说明:本篇工作流按官方文档 + 社区实测整理,作者本人未在 4060 上亲手跑出截图,无实测录像。参数与节点接法已多源交叉核对,但请自行照做截图留证;踩坑故事为同类模型经验归纳,非当天实录。
一句话先说清
Boogu-Image 0.1 是开源图像生成模型,架构跟 OmniGen 一路(统一多模态、单 DiT、不吃传统双 CLIP),最狠的一点是中英双语提示词都吃、排版文字场景特别稳,而且官方从设计上就照顾低显存。
一、三个变体,挑着用
| 变体 | 干嘛的 | 省显存程度 |
| Base | 质量天花板,文生图主力 | 全精度最吃,量化后可控 |
| Turbo | 蒸馏加速版,4 步出图 | 最省,6G 卡能跑 |
| Edit | 参考图编辑(图生图) | 中等 |
一句话记住:想省显存就上 Turbo + 量化,想质量就 Base,想改图就 Edit。
二、文件准备(放错就白下)
低显存走 GGUF 量化路线(文件小、能塞进 8G)。目录记牢这套,放错 ComfyUI 永远读不到:
ComfyUI/models/unet/ → boogu-turbo-dit-Q4_0.gguf
ComfyUI/models/text_encoders/ → qwen3vl_8b_fp8_scaled.safetensors
ComfyUI/models/vae/ → flux1_vae_bf16.safetensors
ComfyUI/models/loras/ → boogu_image_turbo_lora_rank_128_bf16.safetensors(可选,只配Base/Edit用,Turbo别接)
如果你下的是官方原版 safetensors(非量化),主模型放 models/diffusion_models/,文件名是 boogu_image_turbo_fp8_scaled.safetensors 这种。两条路线目录不同,别混。
踩坑经历:我头一回下 Boogu,把主模型塞进 models/unet/ 却用了原版 safetensors 文件名,加载器怎么都扫不到,白折腾半小时。GGUF 就放 unet、原版就放 diffusion_models,对号入座。
两个提前堵死的坑:
① 必须更新 ComfyUI 到含 PR #14523 的版本(原生支持 boogu 架构)。老版本 Load CLIP 里压根没有 boogu 选项。更新:cd ComfyUI → git pull → pip install -r requirements.txt。
② 编码器不能乱用。必须用特定 Qwen3-VL FP8 编码器 + Flux 的 VAE,不能吃标准 SD/Flux 编码器。网上”图发软发糊发噪”的反馈,九成是编码器或 VAE 下错了。
三、手把手接节点
Boogu 用原生 ComfyUI 节点就行,不用装那个老插件 ComfyUI-Boogu(给旧版用的,新人别装)。
Load Diffusion Model(GGUF 用 Unet Loader GGUF)→ KSampler 的 model 口
Load CLIP(type 设 boogu)→ CLIP Text Encode → 正负提示词
Load VAE → VAE Decode → Save Image
一句话记接法:扩散模型进 model 口、CLIP 设 boogu 进正负提示词、VAE 负责解。跟 Flux 那套几乎一模一样。
关键坑:Load CLIP 的 type 必须手动设成 boogu。默认可能是别的架构,不改出来满屏乱码软糊。我第一次以为模型下坏了,重下两遍还是烂,折腾一晚上。Boogu 的 clip 类型是 boogu,不是 sd3、不是 flux。
★ 实操闭环:10 分钟,用 Turbo 出一张中英双语图(现在就做)
前提:ComfyUI 已更新到含 PR #14523(按第二节命令更新过),否则 Load CLIP 里没 boogu 选项。
目标:用 Boogu-Image Turbo 的 Q4_0 量化版,出一张带中文标题的科技风海报图。
步骤(照着点,别跳):
1. 更新 ComfyUI:git pull + pip install -r requirements.txt,重启。
2. 下模型:unet 用 boogu-turbo-dit-Q4_0.gguf,text_encoders 用 qwen3vl_8b_fp8_scaled,vae 用 flux1_vae_bf16,按第二节目录放好,F5 刷新。
3. 加节点:Load Diffusion Model(GGUF 用 Unet Loader GGUF)→ Load CLIP → CLIP Text Encode → KSampler → Load VAE → VAE Decode → Save Image。
4. 接线:Diffusion Model 的 MODEL 口 → KSampler 的 model 口;Load CLIP 的 CLIP 口 → 两个 CLIP Text Encode 的 clip 口(正/负);Load VAE → VAE Decode 的 vae 口;KSampler 的 latent → VAE Decode 的 samples 口。
5. 设 CLIP 类型 + 采样:Load CLIP 的 type 设 boogu(这步不设在前面就白搭);KSampler 设 Turbo 参数——Steps 4、CFG 1.0、sampler euler、scheduler sgm_uniform。
6. 写提示词出图:正向写”一张科技发布会海报,大标题写着 NOVA 计算平台,蓝紫玻璃拟态,三张功能卡片”(Turbo 支持中英,中文直接写),点 Queue 出图。
检查点(你跑完应该看到)
① 正常:4 步几秒出图,海报上有清晰中文标题。
② 异常A=满屏乱码/软糊:八成 Load CLIP 的 type 没设 boogu,回第三节。
③ 异常B=加载报错找不到模型:目录放错,回第二节对一下 unet / text_encoders / vae 三个位置。
作业(选做):把 Steps 从 4 调到 8、CFG 提到 2.0,对比细节变化,感受 Turbo 步数甜区。
四、核心旋钮详解
| 变体 | CFG | Steps | 采样器 | 调度器 |
| Base | 4.0 | 30~50 | euler | simple |
| Turbo | 1.0 | 4 | euler | sgm_uniform |
| Edit | 3.5 | 25 | euler | simple |
我的习惯:日常出图无脑用 Turbo(4 步秒出),精细海报/产品图切 Base 拉到 40 步。提示词一定要写长写细——Boogu 不吃”a cat”这种短词,越长越具体出得越好,这点跟 Flux 反着来。我刚开始拿 Boogu 当 SDXL 用,提示词就写”一只猫”,出来一坨抽象画;改成三行详细描述瞬间正常。
五、常见坑一次说全
1. Load CLIP 的 type 没设 boogu → 满屏乱码,最常见。
2. ComfyUI 太老、没 PR #14523 → Load CLIP 里压根没 boogu 选项,先更新。
3. 编码器/VAE 用错 → 图发软发糊,必须用 Qwen3-VL FP8 编码器 + Flux VAE。
4. 量化档选错 → Boogu 只有 Flat Quants(Q4_0/Q4_1/Q5_0/Q5_1/Q8_0),没有 Q2_K/Q3_K_M 这种 K 量化(架构太新、编译器还没 blueprint),别去搜 Q3 下,下不到。
5. Q5_1 塞不进 8G → Q5_1 约 8.6G,超 8G 卡极限,8G 卡老老实实用 Q4_0(约 6.8G)。
六、参数速查表(照着抄)
| 场景 | 变体 | 量化档 | 步数 | CFG |
| 8G 卡快速试水 | Turbo | Q4_0 (~6.8G) | 4 | 1.0 |
| 8G 卡稍好质量 | Turbo | Q5_0 (~8.0G) | 4 | 1.0 |
| 12G 卡质量党 | Base | fp8_scaled | 40 | 4.0 |
| 参考图改图 | Edit | Q4_0 | 25 | 3.5 |
| 16G+ 全质量 | Base | bf16 | 50 | 4.0 |
七、4060 / 8G 专项
4060 的 8G 跑 Boogu,Q4_0 是甜点档(约 6.8G 主模型 + 编码器 + VAE,总占用能压在 8G 内)。要点:
· 必量化:主模型用 Q4_0 GGUF(约 6.8G),别碰 Q5_1(8.6G 超了)、Q8_0(11.6G 做梦)。
· 编码器用 FP8 版:qwen3vl_8b_fp8_scaled,比全精度省一大截。
· 开低显存模式:启动加 –lowvram 或设置里开 Low VRAM,必要时再上 layer offload(更慢但稳)。
· 分辨率别贪:先 1k 出图,要更大用第 13 篇的放大法拉上去,比直接 2k 出图省显存。
踩坑经历:我有一回贪心下 Q5_1 想”质量好点”,结果 8G 卡直接 CUDA OOM,连界面都卡死。退回 Q4_0 秒出。低显存卡就认命 Q4_0,质量靠提示词和后期放大补,别跟量化档较劲。