论文
WM-Cov:交互式世界模型自动驾驶仿真的测试充分性
WM-Cov: Test Adequacy for Interactive World-Model-Style Autonomous Driving Simulation
摘要
世界模型和生成模拟器正在成为自主驾驶的交互性测试基础设施,因为它们可以与主控者互动并生成反事实、罕见和安全关键的测试轨迹。这改变了测试场景从固定的重放轨迹转变为一个交互性的场景家族,其实际演变依赖于测试中的主控者。因此,问题不仅在于是否可以生成危险的轨迹,还在于什么有效的闭环证据足够支持指定的测试意图和停止决策。本文提出了交互的世界模型式测试的完备性,并引入了WM-Cov,这是一种提供者无关的评估层,将原始提供者输出转换为请求、实现和有效的证据。WM-Cov通过覆盖增长、有效失败发现、失败模式多样性、真实性、艺术抑制、重复计数和有效证据精度报告完备性。执行TeraSim/SUMO事件、WM-like混合轨迹池和一个真实的DriveArena TrafficManager——WorldDreamer矩阵的研究表明,看起来危险的事件可以包括有效的ADS失败、重复、部分实现和艺术。DriveArena矩阵评估了两个主控者、两个时间范围、六个提示条件和360个主控者路线请求;304个尝试成为完全实现的证据,56个仍然部分实现。一个独立的80个请求的路线分割检查产生了74个完全实现和6个部分实现的尝试。结果支持通过预算下的有效交互证据来评估世界模型式测试,而不是通过原始生成的失败或提示覆盖。
