论文

Ledger:第一视角视频中的持久三维物体记忆

Never Look Back: Understanding Persistence in 3D Object Memory from Egocentric Videos

上下文与知识模型评测应用与实践记忆基准与评测资源视觉感知与空间理解

摘要

当我们周游世界并执行日常任务时,我们会遇到一些可能在以后才变得相关的物体。我们能够回忆起我们把东西留在哪里或容器内有什么,即使我们不知道我们以后会需要它。在这里,我们研究了实体助理如何通过观察一个人的日常活动,从以自我为中心的视频中建立类似的记忆。我们推出了 Ledger,一种持久的 3D 对象存储器,它结合了对象位置、它们的历史和上下文描述。它将整个记录中的观察结果关联起来,并在对象离开视图后保留它们,包括那些人从未接触过的对象。它通过静止位置对每个对象的观察进行聚类,并仅在重复证据后记录移动,从而减少定位噪声的影响。简短的描述保留了细节,例如对象的内容或支撑表面。它保存这些记录以便以后回答空间问题,而无需访问原始图像或视频。我们的内存将 HD-EPIC 精度从 29.7% 提高到 42.6%,UCS-Bench 精度从 33.8% 提高到 38.5%, 本地化 Ego4D 对象,返回预测的中值误差为 0.99 m。我们的分析确定了时间持久性、上下文描述和检索的互补作用。我们对 100 个多个场景的拼接流的研究进一步暴露了检索和构建方面的失败。与单场景流相比,按场景构建部分恢复了场景变化时损失的性能。

Ledger:第一视角视频中的持久三维物体记忆:论文原图
图 2:账本概览。 (a) 在采样的自我中心帧中检测到的对象被定位在 3D 中,并使用提供的或估计的相机姿态放置在场景坐标系中。 (b) 由相关观察形成的持久对象记录,包含带时间戳的位置、由重复的位移证据定义的休息段以及上下文描述。 (c) 在查询基础和检索之后,语言模型根据呈现为文本的记录进行回答,而不接收图像。当姿势比例可用时,场景坐标为公制。