论文
MAPLE:端到端自动驾驶的潜在多代理游戏
MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving
摘要
视觉-语言-动作(VLA)模型作为端到端运动规划器是有效的,但由于在传统模仿学习框架下进行训练,因此在闭环设置中进行评估时可能会很脆弱。现有的闭环监督方法缺乏可扩展性,并且无法完全模拟反应环境。我们提出了 MAPLE,这是一种新颖的框架,用于在 VLA 模型的潜在空间中以反应式、多智能体的方式采样轨迹动态驾驶场景。自我车辆和附近的交通代理在多步视野内独立控制,同时对场景中的其他代理做出反应,从而实现闭环训练。 MAPLE 包含两个训练阶段:(1) 基于 真值 轨迹对潜在部署进行监督 微调,其次是 (2) 强化学习,具有全局和特定于代理的奖励,鼓励安全、进步和交互现实主义。我们进一步提出多样性奖励,鼓励模型生成记录的驾驶数据中可能不存在的规划行为。值得注意的是,我们的闭环训练框架是可扩展的,不需要外部模拟器,而外部模拟器的运行计算成本可能很高,并且对现实世界的视觉保真度有限。 MAPLE 在 Bench2Drive 上实现了最先进的驾驶性能,并展示了强大的 E2E 自动驾驶系统的可扩展、闭环多代理游戏。