论文

ReflectDrive-2:用于离散扩散驱动的强化学习对齐自编辑

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving

摘要

我们引入了 ReflectDrive-2,这是一种带有单独的自动驾驶行动专家的屏蔽离散扩散规划器,它将计划表示为离散轨迹标记,并通过并行屏蔽解码生成它们。这种离散的标记空间可以实现就地轨迹修改:自动编辑使用相同的模型重写选定的标记,而不需要辅助细化网络。为了训练这种能力,我们使用两阶段程序。首先,我们沿着纵向前进和横向航向构建专家轨迹的结构感知扰动,并监督模型以恢复原始专家轨迹。然后,我们通过强化学习(RL)微调完整的决策-草案-反映采样轨迹,为最终的编辑后轨迹分配终端驱动奖励,并通过全面采样轨迹过渡传播政策梯度信用。事实证明,全面采样轨迹的 RL 对于耦合起草和编辑至关重要:仅在监督训练下,推理时间 AutoEdit 最多可将 PDMS 提高 0.3,而 RL 将其增益提高至 1.9。我们还为决策-草稿-反射管道共同设计了一个高效的反射解码堆栈,结合了共享前缀 KV 重用、交替步骤解码和融合的设备上解密。在 NAVSIM 上,ReflectDrive-2 在仅使用摄像头输入的情况下实现了 91.0的 PDMS,在 6 中最佳 Oracle 设置中实现了 94.8的 PDMS,同时在 NVIDIA Thor 上以 31.8毫秒的平均延迟运行。