论文
无需训练 通过语言反馈对 VLA 模型故障进行操作纠正
Training-Free Action Correction for VLA Model Failures via Language Feedback
摘要
视觉-语言-动作 (VLA) 模型表现出强大的语义理解,但在部署过程中却表现出系统性故障。这些故障发生的条件以及是否可以在不重新训练的情况下纠正这些故障仍然知之甚少。在本文中,我们采取措施来解决这一差距。我们提出了 CorrectVLA,这是一个框架,可以将任务级自然语言校正转化为附加动作幅度调整,而无需修改策略权重。人工提供单一任务级别的纠正,在所有部署中统一应用,无需每集干预。在模拟中,CorrectVLA 可以恢复分布内任务和 OOD 任务之间的执行错位故障。在环境转变下的 UFactory xArm7 上的真实机器人实验中,CorrectVLA 恢复了近乎完美的成功,其中基本策略几乎完全崩溃,泛化到对象位置和身份。通过对 LIBERO-90 上的故障模式进行分类,我们发现执行错位故障(即策略达到正确目标但错误校准了操作幅度)代表了可纠正的子集,而语义理解本身崩溃的其他故障模式则不适合这种方法。当政策具有战略正确性时,该方法会成功;而当缺乏基本理解时,该方法就会失败,从而为推理时间校正建立了实际的操作边界。