论文

GESTO:以人为中心的时空记忆,用于动态场景中的推理

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

摘要

在人类环境中运行的机器人需要记忆,不仅可以捕获存在的物体和位置,还可以捕获人们随着时间的推移如何使用它们以及个体交互如何组成目标导向的活动。现有的 4D 场景图保留了对象和位置历史,但省略了活动结构,而活动表示要么不基于持久的 3D 场景,要么依赖于外部提供的事件边界和对象关联。我们提出了 GESTO(与场景对齐的事件和时空记忆),这是一种时空记忆,它将持久的 4D 场景图与原子人-物交互和目标驱动事件的两级层次结构结合起来。从 RGB-D 观察流中,GESTO 自动提取带有时间戳的交互,将它们基于持久的场景实体,将它们分组为事件,并使用事件上下文来细化不确定的对象关联。关系感知工具调用代理查询结果内存以进行以活动为中心的时空推理。我们根据现有基准的可重现文本、二进制和时间类别以及 40 个新的 Space2Event 和 Event2Space 查询来评估 GESTO。 GESTO 在标准类别上获得了 0.71、0.75 和 0.70 的分数,接近 真值 事件和对象定位提供的方法,同时在删除这些输入时大大优于相同的推理框架。它在 Space2Event 和 Event2Space 查询上进一步达到 0.73 和 0.75。消融表明,分层事件结构和上下文感知基础细化提供了互补的优势,支持基于活动的分层记忆,以在动态人类环境中进行回顾性推理。