论文

以交互中心表示跨越两指夹爪具身差异

Enabling a Unified Cross-Domain Representation for Two-Finger Gripper Manipulation via Interaction-Centric Modeling

摘要

在模仿学习中实现强大的跨具身泛化需要克服一个关键的表示缺陷,该缺陷将任务语义与特定于硬件的视觉几何密不可分地纠缠在一起。我们提出了一个以交互为中心的框架,该框架通过参数化的通用夹爪抽象来利用两指夹爪的共享结构,产生规范的夹爪框架表示。给定语言和 RGB-D 观察结果,VLM 推断子任务并建立交互三元组(夹爪、被抓物体、目标),而 SAM~2.1 跟踪掩模以减少 VLM 查询。我们设计了简洁的混合特征,将用于全局引导的目标/碰撞人工势场与用于局部几何形状的分段抓手框架点云相结合,并使用流匹配Transformer来预测平滑的 7-DoF 动作块。模拟和现实世界任务中的实验表明,我们的方法是第一种模仿学习方法,可以同时实现有竞争力的基准分数和极端的跨具身/跨视点零样本模拟到真实的迁移到完全不同的异构机器人平台。

跨具身操作框架组合视觉语言感知、夹爪坐标表示与流匹配动作生成。
图2(图注摘要):跨具身操作框架组合视觉语言感知、夹爪坐标表示与流匹配动作生成。