论文

您的驾驶世界模型是全能选手吗?

Is Your Driving World Model an All-Around Player?

模型评测基准与评测资源

摘要

当今的驾驶世界模型可以生成非常逼真的行车记录仪视频,但没有一个模型能够普遍胜出。有些生成逼真的纹理,但违反了基本物理原理;其他人保持几何一致性,但在进行闭环规划时会失败。这种脱节暴露了一个关键的差距:该领域评估真实生成的世界如何出现,但很少评估它们的行为是否真实。我们推出了 WorldLens,这是一个统一的基准,通过五个互补方面和 24 个标准化维度,在整个范围内测量世界模型保真度,从像素质量和 4D 几何到闭环驾驶和人类感知对齐。我们对六个代表性模型的评估表明,没有任何现有方法能够在所有轴上占据主导地位:纹理丰富的模型违反了几何学,几何感知模型缺乏行为保真度,即使是表现最出色的模型在人类真实性评级中也只能获得 2-3 分(满分 10 分)。为了将算法指标与人类感知联系起来,我们进一步贡献了 WorldLens-26K,这是一个包含 26,808 个条目的人类注释偏好数据集,将数字分数与文本原理配对,以及 WorldLens-Agent,这是一个从这些判断中提炼出来的视觉语言评估器,可实现可扩展、可解释的自动评估。基准、数据集和代理一起形成了一个统一的生态系统,不仅可以通过视觉吸引力,还可以通过物理和行为保真度来评估生成的世界。