多模态大模型如GPT-4o在音频感知上存在明显短板,无法正确分辨简单的音量差异;香港中文大学等发布的AV-Odyssey基准测试揭示,现有模型在26个视听任务中的表现接近随机猜测,GPT-4o的准确率仅为34.5%;研究推出DeafTest和AV-Odyssey测试工具,旨在提升多模态大模型的音频和视觉整合能力,特别是音频理解方面的不足。
❯
搜索
扫码打开当前页
返回顶部
幸运之星即将降临……
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠
-
¥優惠使用時效:无法使用使用時效:
之前
使用時效:预期有效优惠编号:×
没有优惠可用!
