论文
FlowR2A:学习多模式驾驶规划的行动奖励分配
FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning
摘要
多模态驾驶规划面临着两种范式之间长期存在的紧张关系:基于评分的方法受益于密集的奖励监督,但仅限于固定的动作词汇,而基于锚的方法动态生成建议,但受到仅限于单个 真值 轨迹的稀疏监督的影响。在这项工作中,我们提出了 FlowR2A,它通过将基于模拟的奖励从判别性目标重新构建为生成条件来解决这种紧张关系。通过使用流匹配解码器从密集轨迹奖励对中学习奖励条件动作分布,FlowR2A 将基于评分的方法的密集监督与基于锚点的方法的提议生成统一在单个生成模型中,迫使模型将动作与其结果在安全性、进度、舒适性和规则合规性方面的相关性内化。为了平衡硬安全约束和软进度目标,我们引入了细粒度的每时间步奖励条件和奖励噪声增强。生成式自然地通过奖励指导和锚定采样支持可控的测试时间采样,从而产生高质量的建议。 FlowR2A 在 NAVSIM v1 和 v2 基准上取得了最先进的结果,其多模态建议的质量远远高于先前的方法。