论文
当指令检索轨迹时:诊断和减轻 VLA 模型中的泛化失败
When Instructions Retrieve Trajectories: Diagnosing and Mitigating Generalization Failures in VLA Models
摘要
视觉-语言-动作 (VLA) 模型在分配任务中的成功率可以超过 90%,并且能够承受保留所需动作的干扰变化,但在需要不同动作的反事实变化时会失败。因此,总体鲁棒性分数可以掩盖更具体的失败,其中策略对语言和视觉做出响应,但没有将它们结合起来选择任务所需的操作。我们将这种失败称为“指令-动作绑定”。指令提示熟悉的轨迹系列,视觉反馈调整其执行。对经过微调的 $π_{0.5}$ 和 GR00T-N1.7 策略的行为分析表明,失败的部署通常会保留源行为或切换到另一个演示的任务。这些转变表明语言并没有被简单地忽视。读数和干预将这些选择与任务条件的内部状态联系起来。我们对模仿目标的分析表明,狭隘的条件行动支持可以使基于指导的解决方案在演示中难以区分。这激发了等变反事实训练(ECT),它在两个层面上发挥作用。 ECT 数据提供了有效的演示,其中相同的指令需要在可区分的场景中执行不同的操作,而 ECT 损失则在同一更新中使用其对应项来训练每个演示。在受控的 LIBERO-PRO 比较中,完整的 ECT 将 $π_{0.5}$ 的平均位置交换成功率从 36% 提高到 59%。在 CALVIN 上,原始数据中已经出现了对应的情况,ECT 损失提高了五项任务的完成率,而无需新的演示。在固定演示预算下的真实 UR5e 上,完整的 ECT 将看不见的位置成功率从 8% 提高到 88%。