论文
DriveReferee:无需学习几何安全判决即可驾驶世界动作模型
DriveReferee: Geometric Safety Verdicts Need Not Be Learned for Driving World-Action Models
摘要
生成世界动作模型(WAM)共同生成未来的视频和车辆动作,而其动作分支仍然主要通过专家模仿进行优化。然而,模仿并没有为生成的轨迹提供明确的闭环几何结论,因此在训练和部署期间验证非常重要。闭环评估器可以检查碰撞和可行驶区域违规,但需要部署时不可用的特权场景状态。现有的方法通常通过从传感器特征中学习验证者来缩小这一差距。对于这些几何检查,规则本身是明确的。例如,通过展开的自我足迹是否与占用的车辆空间重叠来确定碰撞。部署时不可用的是应用规则所需的场景状态。我们引入了 DriveReferee,它使用学习的几何读数来预测相机观察中的场景表示,并直接执行几何安全规则而不是学习它。由此产生的分析裁判根据场景状态和候选轨迹评估碰撞和可行驶区域的安全性。在训练期间,它对真实状态的自采样轨迹进行评分,并将所得偏好提炼到 WAM 策略中。在部署时,同一裁判会根据该预测状态评估生成的轨迹,并在需要时选择更安全的替代方案。分析裁判不需要针对特定判决进行训练,其判决遵循明确的几何规则。在匹配的候选者和推理预算下,它匹配或优于所有学习验证器和启发式基线。考虑到相同的预测状态和轨迹,尽管需要数以万计的评估者标记的训练示例,但学习判决并不能提供可测量的下游增益。在完整的 NAVSIM 导航测试中,DriveReferee 在单摄像头视觉输入且无需外部训练数据的情况下达到了 92.02 PDMS。