10月20日消息,视觉自回归模型的Scaling,往往不像在语言模型里那样有效。谷歌&MIT何恺明团队联手,有望打破这一局面,为自回归文生图模型的扩展指出一个方向:基于连续token的模型比离散token模型在视觉质量上更好。随机顺序生成与光栅顺序相比在GenEval测试上得分明显更好。受到这些发现启发,团队训练了Fluid,一个基于连续标记的随机顺序自回归模型。扩展至百亿参数的Fluid在MS-COCO 30K上zero-shot条件下实现了6.16的FID分数,并在GenEval基准测试中获得了0.69的整体得分。团队希望这些发现和结果能够鼓励未来进一步弥合视觉和语言模型之间的规模差距。(量子位)
❯
搜索
扫码打开当前页
返回顶部
幸运之星即将降临……
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠
-
¥優惠使用時效:无法使用使用時效:
之前
使用時效:预期有效优惠编号:×
没有优惠可用!
