论文
S-EMBER:流式第一人称记忆检索的大规模基准
S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval
摘要
由于可穿戴设备能够实现连续的第一人称记录,人工智能助手必须在很长的时间范围内进行推理,以回忆过去的经历——这种能力被称为情景记忆。当前的基准测试通常依赖于访问整个视频文件的离线评估,无法模拟可穿戴智能的流媒体现实。我们推出 S-EMBER(情景检索的流式第一人称记忆基准),这是一个大规模基准,包含通过 Ray-Ban Meta 智能眼镜捕获的 3,141 个视频,总计 388 小时的有机活动。 S-EMBER 形式化了基于视频证据的流式情景检索,这是从全球离线搜索到由连续流中的视觉事件触发的因果主动回忆的范式转变。我们提供 9,448 个 QA 对,需要通过精确的时间定位进行手动视觉证明,并支持灵活的响应长度来模拟自然的人机交互。我们对前沿模型的广泛基准测试揭示了一个根深蒂固的召回差距:模型在孤立的情况下以中等能力回答和定位,但当两者必须满足相同的查询时,与人类的表现差距最大,最强的达到不到人类速度的一半。 S-EMBER 为下一代可穿戴人工智能代理中开发可靠的情景存储器奠定了硬件真实性基础。