论文
DreamerAD:通过自动驾驶潜在世界模型进行高效强化学习
DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving
摘要
我们推出了 DreamerAD,这是第一个潜在世界模型框架,它通过将扩散采样从 100 步压缩到 1 步,实现自动驾驶的高效强化学习,在保持视觉可解释性的同时实现 80 倍的加速。根据现实世界的驾驶数据训练强化学习策略会带来高昂的成本和安全风险。虽然现有的像素级扩散世界模型可以实现安全的基于想象力的训练,但它们存在多步扩散推理延迟(2 秒/帧),阻碍了高频 RL 交互。我们的方法通过三个关键机制利用视频生成模型中的去噪潜在特征:(1) 通过递归多分辨率步骤压缩降低采样复杂性的捷径强制,(2) 直接对细粒度贡献归因的潜在表示进行操作的自回归密集奖励模型,以及 (3) GRPO 的高斯词汇采样,将探索限制在物理上合理的轨迹。 DreamerAD 在 NavSim v2 上获得了 87.7 EPDMS,确立了最先进的性能,并证明了潜在空间 RL 对于自动驾驶是有效的。