谷歌 DeepMind 团队与麻省理工学院推出全新“Fluid”模型,在规模达 105 亿参数时能取得最佳文生图效果。目前文生图领域共识是自回归模型不如扩散模型,文章介绍了扩散模型和自回归模型,谷歌 DeepMind 和 MIT 团队发现使用连续 tokens 和采用随机生成顺序两个关键设计因素可提高自回归模型性能和可扩展性,连续 tokens 能更精确存储图像信息减少丢失,随机生成顺序让模型能在每一步预测任意位置多个像素表现更出色,结合这两个因素后,规模达 105 亿参数的 Fluid 在重要基准测试中超越了 Stable Diffusion 3 扩散模型和谷歌此前的 Parti 自回归模型,小型 Fluid 模型与拥有 200 亿参数的 Parti 在 MS-COCO 上达到相同分数时表现出显著改进。
❯
搜索
扫码打开当前页
返回顶部
幸运之星即将降临……
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠
-
¥優惠使用時效:无法使用使用時效:
之前
使用時效:预期有效优惠编号:×
没有优惠可用!
