论文

MIGU:操纵规划不确定性下的多模态指令基础

MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning

智能体系统Agent 规划

摘要

理解自然的人类指令对于在以人为中心的环境中部署机器人至关重要。我们研究多模式教学基础,其中语言和手势提供互补但不确定的线索。我们提出了 MIGU,一个模块化框架,它将语义和几何证据结合成一个统一的基础信念,并将其与操纵计划连接起来。 MIGU 通过眼指几何传播观看方向和深度不确定性,同时考虑手方向估计误差,从而构建 3D 几何似然。视觉语言模型 (VLM) 提供候选对象和区域的语义先验,并通过贝叶斯启发的融合与几何似然相结合。由此产生的信念支持行为规划直接进行下游规划或请求澄清。然后,与实际场景对应的目标定义移动操作和桌面任务和运动规划的目标。在现实世界的基准上,MIGU 优于所有评估的基线,而消融支持显式多模态不确定性建模的好处。项目网站:这个http URL