论文

Co-VLA:双臂视觉语言动作系统的协调感知结构化动作建模

Co-VLA: Coordination-Aware Structured Action Modeling for Dual-Arm Vision-Language-Action Systems

摘要

视觉-语言-动作(VLA)模型在单臂和双臂机器人操作方面表现出强大的能力。先前的工作表明,协调的双手行为可以通过端到端学习产生,利用大型视觉语言骨干和连续动作预测。然而,随着双手任务变得紧密耦合并且执行约束变得至关重要,仅隐式协调不足以确保可靠、可解释和稳定的行为。在这项工作中,我们提出了 Co-VLA,一种协调感知的双手操作框架,将显式结构先验引入到 VLA 模型中。我们通过用专为双手协调设计的结构化动作专家(SAE)替换其整体动作头,在最先进的视觉语言骨干上实例化我们的方法。具体来说,我们在动作生成级别引入了显式结构,并具有模块化的协调感知损失,可根据特定于任务的结构塑造共享和残留潜伏。共享潜在变量编码任务级协调意图,而剩余潜在变量捕获每个臂的执行调整。在部署时,潜在感知控制器 (LAC) 解释学习到的表示,以实时调节同步强度、执行不对称性、平滑性和安全约束。 LAC 在联合命令级别运行,并与标准控制管道保持兼容,无需力或阻抗控制。跨模拟和现实世界基准的实验表明,Co-VLA 的性能显着优于整体基线,在紧密协调任务中实现了 27% 的成功率增益,在 OOD 现实世界场景中的性能提高了一倍多(从 13% 到 27%),并将任务完成时间缩短高达 25%。