论文
DualManip:将慢语义推理与快几何适配分开
DualManip: Agentic Dynamic Manipulation via Dual-Path Semantic Reasoning and Geometric Adaptation
摘要
视觉语言模型 (VLM) 支持机器人操作的开放词汇推理,但其高推理延迟限制了动态场景中的响应能力。然而,许多场景变化会改变对象的几何形状,但不会使任务意图失效。我们提出了 DualManip,一个双路径框架,它将不常见的语义推理与响应式几何适应解耦。语义路径分解任务并定位与任务相关的交互,然后是用于姿势优化的约束求解模块。在执行过程中,几何路径通过形状自适应网络不断更新来自实时 RGB-D 观测的模板到观测的对应关系。这些对应关系在观察之间传输与任务相关的抓取接触,从而实现对象运动和非刚性变形下的在线抓取重建。信息交互模块通过从语义基础初始化与任务相关的抓取、验证几何更新以及在更新失败时触发语义重新规划来连接这两条路径。现实世界的评估涵盖六种操纵任务,涵盖非刚性变形、铰接式重构、刚性运动和高精度装配,涉及三种设置:静态、单次变化和连续动态。 DualManip 展示了卓越的操作鲁棒性,特别是在连续场景变化的情况下,同时实现几何适应比Agentic 验证和语义重新规划快约 46 倍。我们的项目页面:https://lichengxi1.github.io/Dualmanip。
