空间智能版ImageNet来了,来自斯坦福李飞飞吴佳俊团队

斯坦福李飞飞和吴佳俊团队发布了HourVideo数据集,专为长视频理解设计,包含500个时长20到120分钟的第一人称视角视频;数据集评估了当前多模态模型在长视频理解上的表现,揭示其远未达到人类专家的理解水平;HourVideo包含18个子任务,涵盖总结、感知、视觉推理等任务,旨在推动AI在长时间视觉处理能力的提升。

搜索