论文
Minerva-Ego:以自我为中心的视频理解的时空提示
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
摘要
视频推理模型是自我中心和实体代理的核心组成部分。然而,评估模型的标准基准仅提供对输出的评估(例如问题的答案),而不评估中间推理步骤,并且大多数仅在文本域中提供答案。我们介绍 Minerva-Ego,这是评估复杂的以自我为中心的视觉推理的基准。我们通过一组具有挑战性的、多步骤的多模态问题和时空密集的人类注释推理轨迹来扩展从自我中心/具体设置记录的最新高质量视频数据源。基准测试表明,最先进的模型与人类的表现仍然存在很大差距。为了详细研究这一差距,我们用解决问题所需的感兴趣对象来注释数据集中的每个推理轨迹,作为时空掩码注释。通过广泛的评估,我们发现通过提示“在哪里”和“何时”查看提示来提示前沿模型可以显着提高性能。 Minerva-Ego 可以在 https://github.com/google-deepmind/neptune 下载。