论文

驱动意图增强以计划为导向的强化学习

Driving Intents Amplify Planning-Oriented Reinforcement Learning

模型训练强化学习

摘要

在每个场景的单个演示轨迹上训练的连续动作策略会遭受模式崩溃:样本聚集在演示的机动周围,并且策略无法表示语义上不同的替代方案。在基于偏好的评估下,这限制了最好的 N 性能——即使是预言机选择也无法恢复采样分布不包含的内容。我们引入了 DIAL,这是一个两阶段的驾驶意图放大强化学习框架,用于偏好一致的持续行动驾驶政策。在第一阶段,DIAL 在具有无分类器引导 (CFG) 的离散意图标签上调节流匹配动作头,这沿着不同的机动模式扩展了采样分布,并打破了单演示模式崩溃。在第二阶段,DIAL 通过多意图 GRPO 将这种扩展的分布携带到偏好 RL 中,该 GRPO 跨越每个偏好组内的所有意图类别,并防止 微调 在当前首选模式周围重新崩溃。使用八个规则派生意图实例化端到端驾驶,并在 WOD-E2E 上进行评估:竞争性视觉到行动 (VA) 和视觉语言行动 (VLA) 监督微调 (SFT) 基线低于人类驱动的演示(128 中最佳),最强先验 (RAP) 上限为评估者反馈分数 (RFS) 8.5,即使是 64 中最佳;意图 CFG 采样将这一上限提升至 RFS 9.14(128 中最佳),首次超越了先前最佳(RAP 8.5)和人工驱动演示(8.13);多意图 GRPO 将保留的 RFS 从 7.681 提高到 8.211,而每个单意图基线峰值都会降低,并在训练结束时降级。这些结果表明,通过演示训练的连续行动策略的偏好强化学习的瓶颈不仅在于如何更新策略,还在于扩展和保持正在优化的样本分布。