论文

CR-VLA-Force:学习控制感知合规性 VLA 模型,用于鲁棒、接触丰富的机器人操作

CR-VLA-Force: Learning Control-aware Compliance VLA Model for Robust Contact-rich Robotic Manipulation

摘要

将视觉运动策略或视觉-语言-动作(VLA)模型与力/扭矩(F/T)感知相结合,已经证明在机器人操作的模仿学习方面取得了重大进展。然而,现有的力感知 VLA 模型在精确力跟踪和快速连续调整方面经常表现出有限的能力。这种缺陷源于动作块执行策略的局限性以及感知和实时控制之间的巨大延迟。这种限制可能会导致任务失败和安全风险,特别是当动作块的执行施加过多的交互力而没有及时调整时。为了克服这一挑战,我们提出了用于反应控制的控制感知合规性 VLA (CC-VLA) 框架。 CC-VLA 模型采用多模态专家混合 (MoE) 来编码力信号序列和视觉语言融合特征。此外,它利用多阶段训练策略来确保视觉语义空间内的鲁棒感知和稀疏采样条件下的有效力感知。此外,VLA 引导的自适应顺从控制器旨在促进无接触运动期间的精确位置跟踪以及针对接触丰富的任务的最佳力位置跟踪。为了促进高精度 F/T 数据采集,我们还实施了对抗共享远程操作策略,以进行接触丰富的演示,从而增强系统的安全性和交互性。大量的现实实验表明,CC-VLA 显着提高了具有挑战性的力感知任务的成功率,并提高了力控制精度,同时在测试的部分 OOD 姿态转换设置下提供了多级安全性和鲁棒性。