论文

ReWAM:交互式自动驾驶的互惠世界行动模型

ReWAM: Reciprocal World Action Models for Interactive Autonomous Driving

智能体系统Agent 规划

摘要

在交互场景中,自动驾驶系统需要在其他智能体行为的影响下产生自我行为。现有的世界行动模型(WAM)通常将其他智能体建模为世界模型的组成部分,而不是从根本上塑造自我智能体行为的决策者,这会损害它们在密集交互场景中的表现。我们引入了互惠世界行动模型(ReWAM),这是一种博弈论世界行动建模框架,通过将自我Agent和其他Agent表示为其行为相互影响的条件响应者来捕获自我Agent和其他Agent之间的相互影响。我们用 Level-$k$ 响应层次结构实例化这个框架,其中角色特定的自我和其他行动 DiT 通过跨Agent注意力交换紧凑的策略词元,同时保持扎根于未来驾驶世界的共享表示。为了从演示中学习自我Agent的响应策略,我们将专家动作制定为最佳响应分布的样本,并使用条件流匹配共同优化整个层次结构。我们的框架在 NAVSIM 数据集上进行评估,与基线相比,实现了最先进的性能。这一改进在交互场景中尤其显着,验证了交互响应建模为交互感知世界动作生成提供了更有效的基础。