Meta AI 推出 LongVU,这是一种全新的时空自适应压缩机制,大幅提升长视频的语言理解能力。该技术巧妙地运用 DINOv2 特征,有效地剔除冗余帧,并且借助跨模态查询达成特征的选择性压缩。在各类视频理解基准测试中,LongVU 展现出卓越非凡的性能,特别是在长视频理解任务方面,更是力压其他方法。
开源地址:
https://vision-cair.github.io/LongVU/
体验地址:
https://huggingface.co/spaces/Vision-CAIR/LongVU
