论文

在相信它的结论之前验证梦想:世界模型模拟器的可接受性

Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators

模型评测评测方法与指标

摘要

在机器人领域,世界模型 (WM) 越来越多地用于通过模拟想象世界中行动的后果来评估行动策略,并返回成功或安全判决。然而,判决的可信度取决于做出判决的 WM,而 WM 本身也需要经过认证。在视频生成 WM 中,Fréchet 视频距离 (FVD) 等保真度指标奖励视觉真实感,但忽略世界是否对策略行为做出正确响应,包括那些在训练中未见过的行为。经典的基于模拟的验证假设一个可信的模拟器评估不可信的策略,而生成式 WM 本身就是未经验证的学习工件。因此,我们认为任何用作测试预言机的 WM 都必须首先获得认可,然后其判决才能作为证据。基于安全关键型仿真的可信度实践,包括验证、确认和认可 (VV&A)、预期功能安全 (SOTIF) 和基于场景的测试标准,我们定义了一个可接受性阶梯 (L0-L4),WM 在其闭环判决被接受为保证证据之前必须攀登该阶梯。我们的框架与实施例无关,并在自动驾驶(AD)中实例化,其中传统模拟的保证方法最为成熟。应用于两个驾驶 WM 时,较低的梯级揭示了一个逆转:在视觉生成质量 (L0) 上排名较高的模型在动作跟踪 (L1-L2) 上排名较低,因此视觉保真度并不能预测闭环判决所依赖的动作鲁棒性。