论文

RefGuard:联合定位目标、参照物与坐标系的语言引导机器人操作

RefGuard: Identity-Aware Language-Guided Robot Manipulation via Joint Target-Anchor-Frame Grounding

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作(VLA)模型具有相当先进的语言引导机器人操作,但可靠的执行仍然取决于识别指令所指的物理对象。在包含重复对象、模糊锚点或依赖于帧的空间术语的杂乱场景中,机器人可以在语义上兼容但非预期的实例上执行几何上有效的动作;我们将这种失败称为身份转换。所指对象由三个耦合的潜在变量共同确定:目标、锚点和参考框架,因此在执行之前提交其中任何一个变量都会将残留的歧义变成无声且不可逆转的错误。我们提出了 RefGuard,这是一种身份感知基础框架,它通过维持所有三个变量的联合后验来延迟承诺。 RefGuard 根据 RGB-D 观察构建一个以帧为条件的以对象为中心的场景图,将独立于帧的几何图形与方向关系分开,并通过执行、澄清、重新观察或中止的决策策略来路由后验。在真正的 UF850 手臂上,RefGuard 在任何模糊性压力试验中都没有记录身份切换,并且在 90.0% 的试验中正确执行,而基于微调的 VLA 和 LLM (大语言模型) 的基线在 33-46% 的相同试验中切换身份,同时在明确场景上保留 93.3% 的成功率,并从定位后场景变化中恢复86.7% 的试验。在 3200 集的程序套件中,与承诺目标之前的锚点和帧的消融相比,它将可解​​指令的正确执行率从 56.6% 提高到 80.5%,同时推迟的频率更少(19.5% 与 43.4%)。