ComfyUI 从安装入门到精通,8G 显存也能跑 FLUX.1? 4060 出人像 / 电商大片

ComfyUI 从安装入门到精通,8G 显存也能跑 FLUX.1? 4060 出人像 / 电商大片

前面 15 篇你基本把 ComfyUI 跑明白了:装机、出图、换风格、控图、锁脸、放大、撸视频,连第 15 篇 ComfyUI 从安装入门到精通,低显存方案:Boogu 让 8G 卡跑原本跑不动的大模型 那种”天生省显存”的 Boogu 模型你也试过了。

但有个”画质天花板”我一直故意没碰——FLUX.1。玩 AI 绘图的人基本公认,FLUX.1 出的人像皮肤质感、手指、还有图里塞文字的排版能力,比 SDXL 高一截。可它全精度要 24G 显存,我那张 4060(才 8G)点开就是 CUDA out of memory,心态直接崩。

我当初就是这么劝退的。看别人秀 FLUX 全精度、秀各种大模型,自己卡死,以为这辈子用不上。后来发现社区把 FLUX.1 做成了 GGUF 量化版——把 23G 压到 6~8G,4060 真能跑。这一篇就把它从”看别人玩”变成”我自己出”。

一、FLUX.1 是什么(大白话)

一句话:FLUX.1 是 Black Forest Labs(就是做 Stable Diffusion 那帮原班人马)出的 12B 参数文生图模型,画质、提示词跟随度、手指结构、图里排文字这几项都强。

版本 干嘛的 授权
dev 质量天花板,本地出图主力 非商用
schnell 蒸馏加速版,1~4 步出图 Apache 2.0 可商用
pro 质量最高 仅 API 闭源

最关键的一件事:全精度要 24G,GGUF 量化版压到 6~8G,8G 卡能跑。

一句话记住:想要 SDXL 级别的”听话 + 质感”又只有 8G 卡?FLUX.1 dev 的 GGUF 量化版就是答案。

二、文件准备(放错就白下)

GGUF 路线四个文件,目录记牢(放错 ComfyUI 永远扫不到):

ComfyUI/models/unet/   → flux1-dev-Q5_K_S.gguf
ComfyUI/models/clip/    → t5xxl_fp8_e4m3fn.safetensors
ComfyUI/models/clip/    → clip_l.safetensors
ComfyUI/models/vae/    → ae.safetensors

两个坑提前堵上:
1. 必须装 ComfyUI-GGUF 插件——Manager 搜 GGUF → 装 ComfyUI-GGUF,重启。普通 Load Checkpoint 读不了 .gguf 文件。
2. 文本编码器用 FP8 版 t5xxl(4.7G),别用 fp16 版(9.4G)——后者单独就快把 8G 吃没了。

踩坑经历:我头一回下 FLUX,文本编码器顺手下了 fp16 版(9.4G),想着”质量好点”,结果和 Q5 主模型一起塞 8G 卡,直接 OOM 连界面都卡死。换成 fp8 版(4.7G)才勉强放下。低显存卡上,文本编码器经常比主模型还容易爆,这个坑我替你踩了。

三、手把手接节点(照着连)

FLUX 不用默认那套 Load Checkpoint,要用 GGUF 专用节点。节点链(端口已核对):

Unet Loader (GGUF) → KSampler 的 model 口
DualCLIPLoader(type=flux) → CLIP Text Encode → FluxGuidance(3.5) → KSampler 的 positive 口
VAE Loader(ae.safetensors) → KSampler 的 vae 口 + VAE Decode 的 vae 口
EmptyLatentImage(1024×1024) → KSampler 的 latent_image 口
KSampler(cfg=1.0, euler, simple, 20步) → VAE Decode → Save Image

一句话记接法:扩散模型进 model 口,双 CLIP 设 flux 经 FluxGuidance 进 positive,VAE 负责解,EmptyLatent 定尺寸。

两个关键坑(和第 15 篇 Boogu 的 type=boogu 同源):
· KSampler 的 CFG 必须设 1.0,不是 SDXL 那套 7~9。FLUX 不用传统 CFG,引导强度在 FluxGuidance 节点单独设 3.5。CFG 设高了图会过曝发灰。
· DualCLIPLoader 的 type 必须设 flux,不是 sdxl、不是 sd3。设错出来的图满屏乱码。

实操闭环:10 分钟,用 4060 出一张 FLUX 人像 / 电商图(现在就做)

前面几节讲原理,这段真刀真枪做一遍。做完你手里多一张能直接用的图,还能确认 FLUX 真在你的 8G 卡上跑通了。

前提:你的 ComfyUI 已装好 + 装了 ComfyUI-GGUF 插件(按第二节下好四个文件)。丢了就回第二节装插件 + 下模型。
目标:用 4060(8G)跑出一张 FLUX.1 dev 质感的人像 / 电商产品图(1024×1024),验证”低显存也能出 FLUX 级画质”。

步骤(照着点,别跳):
1. 下模型:按第二节四个文件放好目录,F5 刷新网页。
2. 加 Unet Loader (GGUF):双击空白 → 搜 unet → 选 Unet Loader (GGUF) → unet_name 选 flux1-dev-Q5_K_S.gguf。
3. 加 DualCLIPLoader:搜 clip → 选 DualCLIPLoader → clip_name1 选 t5xxl_fp8_e4m3fn.safetensors,clip_name2 选 clip_l.safetensors,type 设 flux。
4. 加 VAE Loader:搜 vae → 选 VAE Loader → vae_name 选 ae.safetensors。
5. 加提示词编码:搜 clip text encode → 加 CLIP Text Encode (Prompt) 写正向;再复制一个当负向(留空,FLUX 不用)。
6. 加 FluxGuidance:搜 flux guidance → 加 FluxGuidance → 引导强度设 3.5 → 接在正向 CLIP Text Encode 和 KSampler 的 positive 口之间。
7. 加 EmptyLatentImage:宽 1024、高 1024、批次 1 → 接 KSampler 的 latent_image 口。
8. 加 KSampler:model 接 Unet Loader 输出,positive 接 FluxGuidance 输出,negative 接空 CLIP Text Encode,vae 接 VAE Loader 输出;sampler=euler、scheduler=simple、steps=20、cfg=1.0。
9. 加 VAE Decode + Save Image:VAE Decode 接 KSampler 输出 + VAE Loader 输出 → Save Image 接 VAE Decode 输出。
10. 启动加低显存:命令行 python main.py –lowvram 启动,点 Queue Prompt 出图。

检查点(你跑完应该看到):① 正常:节点逐个变绿,output 出一张 1024² 图,皮肤质感干净、手指正常(FLUX 强项),无粉色 / 品红块;② 异常A=一团噪声没收敛 / 图发灰发白:八成 KSampler 的 cfg 还设成默认 7 或 scheduler 用了别的 → 改 cfg=1.0 + euler + simple;③ 异常B=粉色 / 品红块:VAE 错(没用 ae.safetensors 或没接 VAE Decode 的 vae 口)→ 回第二节核对;④ 异常C=节点红色报错”找不到节点”:用了普通 Load Checkpoint 而非 Unet Loader (GGUF),回去装 ComfyUI-GGUF 插件;⑤ 异常D=显存爆(OOM):没加 –lowvram,或分辨率太高 → 启动加 –lowvram,先 832×832 试。

作业(选做):把 FluxGuidance 引导强度从 3.5 调到 5.0 再出一张,对比提示词跟随度;或把正向提示词里的 “studio lighting” 改成 “golden hour lighting”,看光影变化。

四、核心旋钮详解

项目 dev 推荐 schnell 说明
步数 Steps 20 1~4 dev 蒸馏版 20 步够
CFG 1.0 1.0 FLUX 不用 CFG
引导强度 3.5 3.5 想更听话 4~5,更自由 2~3
采样器 euler euler FLUX 标配
分辨率 1024×1024 1024×1024 也支持其它比例

我的习惯:日常无脑 dev 20 步 + 引导 3.5;要快用 schnell 4 步(可商用);提示词写长写细、用自然语言,FLUX 理解长描述比堆权重好。

踩坑经历:我第一次把 FLUX 当 SDXL 用,KSampler 的 cfg 随手填了 7,出来一坨过曝灰白垃圾。查了半天才知道 FLUX 的 cfg 必须 1.0,引导强度走 FluxGuidance 节点。这个坑新人必踩,记死。

五、常见坑一次说全

1. KSampler 的 cfg 没设 1.0 → 过曝灰白,最常见。
2. 用了普通 Load Checkpoint / DualCLIPLoader 没设 type=flux → 输出乱码或报错,GGUF 用 Unet Loader (GGUF),CLIP 的 type 设 flux。
3. 文本编码器下 fp16 版 t5xxl(9.4G) → OOM,换 fp8 版(4.7G)。
4. VAE 用错 / 没接 → 粉色块,必须用 ae.safetensors 且接 VAE Decode 的 vae 口。
5. 没加 –lowvram → 8G 卡 OOM,启动命令加 –lowvram。
6. 写了负向提示词 → FLUX 不吃,写了也不生效(接空 negative 节点 OK,但填了词白填)。

六、参数速查表(照着抄)

场景 变体 量化档 步数 CFG 引导
8G 卡质量党 dev Q5_K_S (~8G) 20 1.0 3.5
8G 卡更稳 dev Q4_K_S (~6.8G) 20 1.0 3.5
12G 卡 dev Q8_0 (~13G) 20 1.0 3.5
极速可商用 schnell Q4_K_S 4 1.0 3.5
16G+ dev fp8 20 1.0 3.5

七、4060 / 8G 专项 & 我踩的坑

4060 的 8G 跑 FLUX,Q5_K_S 是甜点档(~8G 主模型 + fp8 t5 4.7G + VAE,靠 –lowvram 流式加载压在 8G 内)。要点:

· 主模型 Q5_K_S(~8G),不够稳就降到 Q4_K_S(~6.8G)。
· 文本编码器必须 fp8 版 t5xxl(4.7G),别碰 fp16(9.4G)。
· 启动加 –lowvram;出图慢点但稳。
· 分辨率先 1024²,要更大用第 13 篇的放大法拉上去。
· 出图时关掉其它占显存的程序。

踩坑经历:我贪心想”质量好点”下了 Q8_0(13G),8G 卡直接 OOM 卡死。退回 Q5_K_S 秒出。低显存卡认命 Q5,质量靠提示词和后期放大补,别跟量化档较劲。

FLUX 会跑了,你已经摸到了本地画质天花板。但装插件这事儿你早晚要反复折腾——怎么高效地装、更新、排查冲突,直接影响你后面玩多少模型。第 17 篇讲自定义节点 + Manager,把这套门道讲透。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
教程百科

ComfyUI 从安装入门到精通,低显存方案:Boogu 让 8G 卡跑原本跑不动的大模型

2026-8-24 9:20:06

资讯

字节跳动相关人士回应“研发 AI 手机”:实为基于手机的大模型软件解决方案

2024-6-12 13:55:19

搜索