论文
世界模型作为对手:用于鲁棒运动规划的多智能体自我博弈 微调
World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning
摘要
密集交通中的稳健运动规划需要自动驾驶车辆在自然驾驶数据中代表性不足的罕见且安全关键的场景中进行交互。尽管对抗性训练提供了可行的解决方案,但现有方法通常依赖于外部场景生成器、启发式扰动或大量模拟器轨迹采样,这使得它们难以与现代自回归规划器集成。在这里,我们将对抗性鲁棒规划学习视为一种受约束的最小-最大游戏,并提出对抗性世界建模(AWM),这是一种基于理论的多智能体自博 微调 框架。由于求解精确的游戏很困难,AWM 引入了一种有原则的解耦求解器。在内部最小化中,规划者的预测世界模型被转换为角色条件对手,通过反事实信用分配学习稀疏的、场景自适应的攻击联盟。在外部最大化中,自我规划器针对冻结的 AWM 优化了后悔感知的鲁棒最佳响应,利用尾部风险权重和参考锚定信任区域来改善困难情况恢复,同时保留名义驾驶行为。 nuPlan 和 InterPlan 基准的实验表明,我们的方法生成可转移的对抗性交互,并产生一个强大的规划器,可以在名义和高度交互的长尾场景中实现有竞争力的闭环性能。理论分析证明了解耦求解器和主要优化组件的合理性。