谷歌与麻省理工推出 Fluid 模型,AI 文生图领域自回归模型超越扩散模型

谷歌 DeepMind 团队与麻省理工学院推出全新“Fluid”模型,在规模达 105 亿参数时能取得最佳文生图效果。目前文生图领域共识是自回归模型不如扩散模型,文章介绍了扩散模型和自回归模型,谷歌 DeepMind 和 MIT 团队发现使用连续 tokens 和采用随机生成顺序两个关键设计因素可提高自回归模型性能和可扩展性,连续 tokens 能更精确存储图像信息减少丢失,随机生成顺序让模型能在每一步预测任意位置多个像素表现更出色,结合这两个因素后,规模达 105 亿参数的 Fluid 在重要基准测试中超越了 Stable Diffusion 3 扩散模型和谷歌此前的 Parti 自回归模型,小型 Fluid 模型与拥有 200 亿参数的 Parti 在 MS-COCO 上达到相同分数时表现出显著改进。

搜索