论文
Ledger:第一视角视频中的持久三维物体记忆
Never Look Back: Understanding Persistence in 3D Object Memory from Egocentric Videos
摘要
当我们周游世界并执行日常任务时,我们会遇到一些可能在以后才变得相关的物体。我们能够回忆起我们把东西留在哪里或容器内有什么,即使我们不知道我们以后会需要它。在这里,我们研究了实体助理如何通过观察一个人的日常活动,从以自我为中心的视频中建立类似的记忆。我们推出了 Ledger,一种持久的 3D 对象存储器,它结合了对象位置、它们的历史和上下文描述。它将整个记录中的观察结果关联起来,并在对象离开视图后保留它们,包括那些人从未接触过的对象。它通过静止位置对每个对象的观察进行聚类,并仅在重复证据后记录移动,从而减少定位噪声的影响。简短的描述保留了细节,例如对象的内容或支撑表面。它保存这些记录以便以后回答空间问题,而无需访问原始图像或视频。我们的内存将 HD-EPIC 精度从 29.7% 提高到 42.6%,UCS-Bench 精度从 33.8% 提高到 38.5%, 本地化 Ego4D 对象,返回预测的中值误差为 0.99 m。我们的分析确定了时间持久性、上下文描述和检索的互补作用。我们对 100 个多个场景的拼接流的研究进一步暴露了检索和构建方面的失败。与单场景流相比,按场景构建部分恢复了场景变化时损失的性能。
