论文

CompVLA:用于丰富接触操作的可变顺应性视觉-语言-动作模型

CompVLA: A Variable Compliance Vision-Language-Action Model for Contact-rich Manipulation

摘要

富含接触的操作,要求机器人不仅要调节运动,还要调节它们如何屈服于外力,已成为视觉-语言-动作(VLA)模型的下一个前沿领域。然而,现有的 VLA 输出纯粹的运动命令,从而降低了现实世界中接触丰富的任务的性能。在本文中,我们介绍了 CompVLA,这是一个统一的 VLA 框架,可以根据 RGB 和语言输入联合预测运动和刚度矩阵。我们的方法通过专门的合规专家增强了传统架构,该专家输出通过几何阻抗控制执行的时变刚度和虚拟位移曲线。我们证明,CompVLA 在各种接触丰富的任务中实现了最高的平均成功率,优于普通 VLA 基线和合规意识 VLA 基线,并通过消融确认每个组件都是必不可少的。