论文
SuperMemory-VQA:长视记忆的以自我为中心的视觉问答基准
SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory
摘要
人工智能眼镜为人工智能代理提供了一个引人注目的平台,充当个性化记忆助手。为了真正有用,这样的系统必须超越短期视频理解,并解决人类在纵向自我中心视频流中出于实际、个人或社会目的而经历的记忆差距。然而,现有的以自我为中心的数据集主要关注动作识别或短片中的通用问答,测量感知能力而不是现实的人类记忆需求。我们引入了 SuperMemory-VQA,这是一个以自我为中心的视觉问答 (VQA) 数据集,用于评估人工智能助手在实际的长期记忆任务上的表现。它包含使用 AI 眼镜记录的 52.9 小时的日常活动,包括同步 RGB 视频、音频转录、眼睛注视、IMU 和 SLAM 轨迹。通过人工验证的注释管道,我们构建了 4,853 个有证据支持的问题答案对,涵盖对象和位置记忆、意图回忆、视觉场景回忆、时间线重建、对话记忆和上下文检索。每个问题都以多项选择的形式提出,并有一个明确的“无法回答”的选项来测试幻觉的稳健性。对领先的代理框架和 LLM 主干网进行基准测试表明,现有系统在现实世界的内存任务上仍然远不可靠,这凸显了对扎根 AI 内存的新架构的需求,这种架构只有在证据充足时才能给出答案。一项参与者调查进一步证明我们的问题是现实的、有用的,并且符合日常记忆需求。