论文

通过表征锚定和语言动作对齐进行泛化 VLA 微调

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

模型训练监督微调与指令调优

摘要

通过行为克隆 (BC) 微调机器人演示上的预训练视觉语言模型 (VLM) 已成为视觉语言动作 (VLA) 策略的标准配方。然而,BC 微调逐渐覆盖支持视觉和语义泛化的预训练表示。对网络图像-文本数据进行联合训练是一种常见的补救措施,它将语言和动作损失应用于单独的观察,使 VLA 出现标准操作基准不会暴露的语言-动作错位。我们提出了 Anchor-Align,它通过两个目标增强 BC:视觉语言锚定从冻结的 VLM 副本中提取分层表示以防止这种漂移,而语言动作对齐将每个动作目标转换为离散的运动方向标签,并在同一机器人观察上联合训练语言和动作预测。我们使用带有回归和流程匹配动作头的两种 VLA 架构,对单臂 xArm7 和双手 YAM 机器人的八种操作设置进行了实际评估。在这些设置中,Anchor-Align 在新目标、布局和需要协调控制的运动敏感双手任务方面始终优于 BC。在大规模模拟中,我们分别证明了 LIBERO-PRO、LIBERO-Plus 和 CALVIN 在 OOD 扰动、感知鲁棒性和长视野控制方面的一致改进,这表明保留预训练表示和有效的动作学习并不存在根本冲突。项目页面:anchoralignvla.github.io