论文

以米为单位:学习米制交互以实现精确的机器人操作

Acting in Meters: Learning Metric Interactions for Precise Robotic Manipulation

模型架构新型架构

摘要

视觉-语言-动作模型和世界动作模型具有先进的语言条件机器人操作,但通常会隐含动作、对象和场景几何之间的度量关系。人类操纵将对任务相关对象的语义理解与指导手部相对于对象及其周围环境的运动的空间反馈相结合。受此启发,我们引入了一个度量交互框架,该框架以共享度量尺度对物理笛卡尔空间中的对象级和场景级交互进行建模。在对象级别,以交互为中心的词元(ICT)明确表示相对于被操纵对象的末端执行器姿势轨迹,并与动作联合去噪,提供基于物理的交互监督。在场景级别,度量动作交互场 (MAIF) 使用动作和 ICT 查询来处理度量场景点云特征并学习几何条件动作校正。通过两阶段适应,我们的框架通过少量的额外参数和训练步骤改进了不同的 VLA 和 WAM 基线。实验表明,LIBERO 和 RoboTwin 2.0 的平均成功率分别提高了 0.80 和 3.59 个百分点,而现实世界任务的平均成功率提高了 6.80 个百分点,其分布外变体的平均成功率提高了 7.45 个百分点。