斯坦福李飞飞和吴佳俊团队发布了HourVideo数据集,专为长视频理解设计,包含500个时长20到120分钟的第一人称视角视频;数据集评估了当前多模态模型在长视频理解上的表现,揭示其远未达到人类专家的理解水平;HourVideo包含18个子任务,涵盖总结、感知、视觉推理等任务,旨在推动AI在长时间视觉处理能力的提升。
❯
搜索
扫码打开当前页
返回顶部
幸运之星即将降临……
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠
-
¥優惠使用時效:无法使用使用時效:
之前
使用時效:预期有效优惠编号:×
没有优惠可用!
