论文

将多轨迹监督与 VLA 驾驶策略优化相结合

Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving

模型训练强化学习

摘要

视觉-语言-动作(VLA)驱动方法越来越多地将多轨迹模仿学习与群体相关策略优化(GRPO)结合起来,使得轨迹选择对最终性能至关重要。然而,一些改善模仿的高分轨迹可能会导致与当前策略的可行行为分布不一致的优势估计,从而导致更新远离安全和合规的行为,从而降低后续的 GRPO 性能。为了解决这个问题,我们提出了一种新颖的框架,将多轨迹监督与策略优化结合起来。为了解决可行区域外的不可行噪声轨迹引起的策略梯度偏差,将增强轨迹限制在真值可行区域的邻近流形上,并采用帕累托最优标准代替传统的总分,仅保留非支配候选,从而从源头过滤掉冲突样本。为了确保在策略优化过程中有效吸收扩大的轨迹监督,我们引入了两种补充机制:可行性优先优势分配和动态蒸馏。前者使帕累托信用适应每个轨迹采样组的可行性组成,并引导完全不可行的组走向安全参考。后者在各轮细化中更新教师轨迹,以不断传递有用的监督。他们共同逐步将扩大监督的好处转化为政策改进。在 NAVSIM v1 和 v2 上,我们的方法在单轨迹推理下分别实现了 91.4 PDMS 和 89.1 EPDMS,并恢复了 658 个最初失败场景中的 440 个场景,比原始 GRPO 基线高 11.1%。