论文
CounterAlign:视觉-语言-动作模型的反事实监督
CounterAlign: Counterfactual Supervision for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型通常通过专家演示的行为克隆 (BC) 进行训练。然而,BC 只对专家行为提供积极监督,而没有明确的消极监督来表明哪些行为与指令不一致或其他不适当。强化学习(RL)可以提供此类纠正信号,但通常依赖于外部指定的奖励或策划的非专家数据,这两种方法在机器人技术中获取成本都很高。我们证明,VLA 模型的离线 RL 不需要依赖于策划的非专家轨迹:成功的专家演示本身就可以通过指令重新标记转化为密集的纠正监督。具体来说,通过将专家动作与不匹配的替代指令配对,我们从数据集中合成反事实指令-观察-动作元组,并将它们与对抗性判别器训练相结合,以学习基于指令的离线强化学习奖励模型,而无需收集额外的展示或注释。在注重鲁棒性的 LIBERO-PRO 基准上,我们的方法在强大的最先进基线上提高了对对象位置和任务扰动的鲁棒性。在 TX-G2(与 AGIBot G2 兼容)上的真实机器人实验中,它的性能也优于竞争基线。更广泛地说,我们的结果表明,对于数据受限的 VLA 学习,从每个演示中提取更密集的监督可以补充收集额外的数据。