智源研究院联合多所高校推出的超长视频理解大模型 Video-XL。借助语言模型对长视觉序列进行压缩,在长视频理解上表现出色,在多个主流长视频理解基准评测中多项任务排名第一,仅需一块 80G 显存显卡即可处理小时级长度视频采样,并在视频“海中捞针”任务中准确率接近 95%。模型代码已开源,未来有望在多个应用场景中发挥价值。通过单项任务评测、消融实验等证明了模型的有效性,包括在长视频、超长视频和短视频理解任务中的表现,以及视觉压缩机制和 VICO 数据集的有效性。
论文链接:
https://arxiv.org/abs/2409.14485
模型链接:
https://huggingface.co/sy1998/Video_XL
项目链接:
https://github.com/VectorSpaceLab/Video-XL
