论文

失败前行:视觉-语言-行动模型的自适应失败知情学习

Failing Forward: Adaptive Failure-Informed Learning for Vision-Language-Action Models

模型训练偏好优化

摘要

视觉-语言-动作(VLA)模型为可扩展的机器人操作提供了一个有前途的范例,但它们对仅成功的行为克隆的依赖使它们变得脆弱;如果缺乏纠正性的训练信号,微小的执行错误很快就会变成不可恢复的、超出分布的故障。为了解决这一限制,我们提出了自适应故障知情学习(AFIL),这是一种端到端框架,利用故障轨迹作为基于扩散和流动的 VLA 策略的自适应负面指导。 AFIL 使用预训练的 VLA 在线生成故障部署,避免了手工故障模式设计或人机交互恢复的需要。然后,它联合训练双动作生成器 (DAG) 的成功和失败行为,同时共享共同的视觉语言主干,从而以有限的参数开销实现高效的故障感知策略学习。在采样过程中,失败生成器自适应地将动作生成从容易失败的区域转向更可靠的成功模式,指导强度由成功和失败分布之间的每个扩散步距离决定。跨域内和域外机器人操作任务(涵盖短期和长期设置)的实验表明,AFIL 相对于现有 VLA 基线持续提高任务成功率和鲁棒性,证明了其有效性、效率和通用性。