论文

WM-Cov:交互式世界模型自动驾驶仿真的测试充分性

WM-Cov: Test Adequacy for Interactive World-Model-Style Autonomous Driving Simulation

模型评测评测方法与指标

摘要

世界模型和生成模拟器正在成为自主驾驶的交互性测试基础设施,因为它们可以与主控者互动并生成反事实、罕见和安全关键的测试轨迹。这改变了测试场景从固定的重放轨迹转变为一个交互性的场景家族,其实际演变依赖于测试中的主控者。因此,问题不仅在于是否可以生成危险的轨迹,还在于什么有效的闭环证据足够支持指定的测试意图和停止决策。本文提出了交互的世界模型式测试的完备性,并引入了WM-Cov,这是一种提供者无关的评估层,将原始提供者输出转换为请求、实现和有效的证据。WM-Cov通过覆盖增长、有效失败发现、失败模式多样性、真实性、艺术抑制、重复计数和有效证据精度报告完备性。执行TeraSim/SUMO事件、WM-like混合轨迹池和一个真实的DriveArena TrafficManager——WorldDreamer矩阵的研究表明,看起来危险的事件可以包括有效的ADS失败、重复、部分实现和艺术。DriveArena矩阵评估了两个主控者、两个时间范围、六个提示条件和360个主控者路线请求;304个尝试成为完全实现的证据,56个仍然部分实现。一个独立的80个请求的路线分割检查产生了74个完全实现和6个部分实现的尝试。结果支持通过预算下的有效交互证据来评估世界模型式测试,而不是通过原始生成的失败或提示覆盖。

WM-Cov:交互式世界模型自动驾驶仿真的测试充分性:论文配图
图4:DriveArena 的 TrafficManager–WorldDreamer 六提示矩阵中,请求次数与实际完成次数的对应。每个热图单元格汇总一个规划器、提示和时间跨度组合下15次请求的闭环自车路线尝试。在 WM-Cov 中,完整实现的轨迹与由 pkl 文件支撑的部分实现是不同的证据对象。矩阵显示,实际实现情况取决于规划器、时间跨度和提示;只看原始请求数会掩盖 UniAD 在默认多云天气、7.5秒条件下的提供链失败,以及反复出现的7.5秒部分实现现象。