谷歌&MIT何恺明团队:视觉大模型像LLM一样高效Scaling,指路连续token+随机生成顺序

10月20日消息,视觉自回归模型的Scaling,往往不像在语言模型里那样有效。谷歌&MIT何恺明团队联手,有望打破这一局面,为自回归文生图模型的扩展指出一个方向:基于连续token的模型比离散token模型在视觉质量上更好。随机顺序生成与光栅顺序相比在GenEval测试上得分明显更好。受到这些发现启发,团队训练了Fluid,一个基于连续标记的随机顺序自回归模型。扩展至百亿参数的Fluid在MS-COCO 30K上zero-shot条件下实现了6.16的FID分数,并在GenEval基准测试中获得了0.69的整体得分。团队希望这些发现和结果能够鼓励未来进一步弥合视觉和语言模型之间的规模差距。(量子位)

搜索