论文

相同场景,不同任务:VLA 中构图泛化的技能调整

Same Scene, Different Task: Skill Alignment for Compositional Generalization in VLAs

模型训练监督微调与指令调优

摘要

视觉-语言-动作 (VLA) 模型通常很难推广到微调演示中缺少的技能组合,即使每项组成技能都已得到演示。我们将视觉快捷方式作为一种失败模式:在微调期间,视觉观察可以作为指令的代理,因此策略可以执行与类似观察相关的演示组合,而不是指令组合。这激励了通过固定演示观察而形成的反事实对进行训练,同时更改指令以指定未经演示的组合。然而,这些对缺乏相应的已证实的行动目标。至关重要的是,当前所需的技能已经得到证明,但这些执行的操作不能作为直接目标,因为相同的技能可能需要在观察中采取不同的操作。我们提出了 CRAFT,它将监督从所需技能的演示执行转移到使用可以在相同技能的执行中重复使用的技能表示的反事实对。在三个 VLA 模型和两个模拟基准中,CRAFT 提高了未经证明的组合的成功率,同时在已证明的组合上保持了较高的成功率;它还提高了真实机器人的组合概括。项目网址:https://taegeunyang.github.io/craft/