智源 Emu3 证明多模态模型新范式:只需基于下一个 token

智源研究院发布了原生多模态世界模型Emu3,该模型基于下一个token的预测来理解和生成文本、图像、视频三种模态数据;Emu3超越了传统扩散模型和组合方法,展现出在图像生成、视觉语言理解、视频生成等多模态任务中的优越性能;该模型通过预测下一个token作为多模态模型的新范式,证明了其在大规模多模态学习中的应用潜力和效果。

搜索