论文
通过视觉-语言-动作模型的故障库自我进化从运行时反馈中学习
Learning from Runtime Feedback through Failure-Bank Self-Evolution for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型广泛适用于机器人操作任务,但复杂的环境需要平衡任务成功与意外接触。运行时防护可以纠正单个操作,但它们会使底层策略保持不变,因此重复的分歧可能会造成持续的策略防护不匹配,从而阻碍任务进展。为了应对这一挑战,我们引入了 FailBank,这是一个四阶段自我进化框架,可将运行时反馈转化为持久的策略改进。在收集过程中,基于 CBF 的固定安全模块充当仅观察教师,在策略保持控制的同时产生反事实修正。然后,结果感知准入将有用的建议转化为纠正目标,并保留成功的未纠正行动,作为受保护的 LoRA 更新的安静锚点。我们在 VLA-Arena 基准上评估了 FailBank 的两个难度级别和两个 VLA 主干。与基础策略相比,FailBank 提高了联合成功成本操作点。在两个骨干网中,FailBank 将任务成功率提高了 8.5 个和 6.9 个百分点,同时将策略引起的累积成本分别降低了 35.6% 和 23.8%。与运行时屏蔽相比,FailBank 将任务成功率提高了 25.4 个和 9.5 个百分点,同时保持了可比较的策略诱导累积成本。这些结果表明,运行时反馈可以作为持久的策略监督,而不仅仅是作为临时的行动约束。