论文

ECHO:具身视角下人类搬动物品的场景数据与评测

ECHO: Embodied Camera Observations of Human Object Carrying

模型评测上下文与知识应用与实践上下文工程基准与评测资源机器人

摘要

具身和辅助智能体必须做的不仅仅是识别物体:它们必须根据环境的布局和居住在其中的人们的习惯来推理物体所属的位置。这个问题的进展有限,部分原因是没有专门的基准或数据集来定义和评估它。现有的 RGB-D 扫描数据集在没有人类活动的情况下重建静态房间,而人机交互数据集在没有可导航、完全重建的场景或物体自然目的地的真实概念的情况下捕获运动。我们引入上下文对象放置作为基准任务:在观察到的对象携带事件中预测对象的目的地。为了支持这项任务,我们提出了人体携带物体的实体相机观察(ECHO),这是一个大规模的合成数据集,它将室内场景的密集 RGB-D 扫描与实体人体携带日常物体到适合环境的目的地的记录配对。 ECHO 是第一个公开的数据集,结合了重建场景、人类活动、自然语言和 上下文放置注释。它由 159 层楼的 115 个 HM3D 场景中的 3,805 个人工注释剧集组成,涉及 198 个不同的对象。每层楼都包含完整的 RGB-D 扫描,带有人工注释的房间标签和表面列表。每集提供同步的 RGB-D 遭遇片段; 6-DoF 相机、人和物体轨迹;起始表面和目的地表面;动作标题;以及人类书写的上下文:描述居民日常活动的单个句子,暗示目的地但未命名。我们使用输入屏蔽探针和端到端基线来评估上下文对象放置。结果表明,单一输入方式是不够的,这凸显了对场景结构、人类活动和上下文知识进行联合推理的需要。