论文

面向具身消歧的主动感知

Active Perception for Embodied Disambiguation

智能体系统Agent 环境交互

摘要

自然语言为机器人提供了灵活的任务接口,但具身环境中的目标歧义不仅源于用户意图,也可能源于当前观测中缺失与任务相关的物理证据。现有的交互式消歧方法主要通过询问用户来获取额外信息,而遮挡、受限视点、不可读文本和未观测到的目标则要求机器人主动改变其观测。我们提出一个用于具身目标消歧的主动感知框架,以主动观测作为信息获取的主干,并使用视觉语言模型基于累积的视觉证据与交互信息,决定继续观测、请求澄清还是完成目标选择。主动观测既能直接恢复缺失的判别性证据,也能揭示物体名称、标签和语义属性,从而在仍需澄清时改进用户澄清的效果。真实机器人实验表明,该框架将物理信息获取与用户意图澄清结合到统一的具身消歧过程中。

面向具身消歧的主动感知:论文配图
图2:PiPER 平台搭载眼在手(eye-in-hand)式 DABAI DC1 RGB-D 相机的实验装置。