论文
RoXDrive:通过忠实行动的部署实现端到端自动驾驶的闭环强化学习
RoXDrive: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving via Action-Faithful Rollouts
摘要
端到端自动驾驶策略通常是通过对记录的演示进行模仿学习来训练的,而不观察其自身行为的后果,从而导致闭环现实世界部署中的因果混乱。为了解决这个问题,强化学习 (RL) 后训练提供了一种有前途的替代方案,它利用世界模型作为交互式训练环境,以生成未来的场景以改进政策。然而,现有的方法要么依赖基于重建的模拟器,提供有限的反事实交互,要么采用合成模拟器来实现长视野闭环交互,但代价是模拟与真实之间存在巨大差距。最近,视频世界模型表现出了生成现实的多步骤未来部署的能力,但可能无法忠实地反映动作条件,从而导致动作与视觉不匹配。在本文中,我们介绍了 RoXDrive,一种即插即用的闭环 RL 框架,它通过识别忠实于动作的世界模型rollout来实现可靠的策略优化,包括两个阶段:1)模型预训练:除了基于模仿的策略预训练之外,我们还设计了一个动作视觉忠实评估器,通过我们的几何感知辅助轨迹监督进行逆动态估计,从而能够对视觉动态是否忠实反映调节自我动作进行长期评估。 2)忠实于动作的强化学习后训练:智能体与世界模型迭代交互,形成长视野场景展示,仅保留忠实于动作的场景,以进行密集的安全意识评分和场景级闭环强化学习后训练。在 nuScenes 和包含超过 130K 训练场景的内部数据集上进行的广泛实验表明,规划者之间取得了一致的收益,在 nuScenes 上使用 DiffusionDrive 将安全违规行为减少了 27.6%,在内部数据上使用 Qwen3-VL 将安全违规行为减少了 33.7%。