港中文「视觉听觉」基准AV-Odyssey:26个任务直指死角问题

多模态大模型如GPT-4o在音频感知上存在明显短板,无法正确分辨简单的音量差异;香港中文大学等发布的AV-Odyssey基准测试揭示,现有模型在26个视听任务中的表现接近随机猜测,GPT-4o的准确率仅为34.5%;研究推出DeafTest和AV-Odyssey测试工具,旨在提升多模态大模型的音频和视觉整合能力,特别是音频理解方面的不足。

搜索