论文
FIRE-VLA:自动驾驶中视觉-语言-动作模型的故障通知自我进化
FIRE-VLA: Failure-Informed Self-Evolution for Vision-Language-Action Models in Autonomous Driving
摘要
强化学习通过评估从当前策略中采样的轨迹来改进自动驾驶视觉语言动作(VLA)模型。组相对策略优化 (GRPO) 从每个轨迹组内的奖励差异中学习。当所有采样轨迹都很差时,该相对信号可以对故障进行排名,而无需识别故障区域之外的行为。我们引入了 FIRE-VLA,这是一个失败通知的自我进化框架,它将此类未解决的失败转化为下一个策略的特权监督。低奖励、低多样性群体会从同一模型的冻结回合开始副本中触发自我 蒸馏。教师和学生具有相同的参数尺度,但只有教师观察隐藏的未来轨迹。监督遵循学生生成的前缀,并仅限于回答标记,而 GRPO 对每个组都保持活动状态。更新后的策略为下一轮提供教师,允许路由失败分布随策略而变化,而不需要更大的外部教师。从相同的 Qwen2.5-VL-3B SFT 检查点开始,比较匹配学生执行轨迹和策略更新计数。在来自 150 个保留的 nuScenes 场景的 6,019 个示例中,FIRE-VLA 保留了可比较的单样本规划,将 G=4 平均 L2 从 1.848 减少到 1.500 m,并将评估持续失败率从 13.03% 降低到 11.20%。平均误差的减少主要来自罕见的严重失误轨迹,而不是普通轨迹上的统一改进。