EgoDyn-Bench:评估自动驾驶以视觉为中心的基础模型中的自我运动理解
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving
摘要
虽然视觉语言模型(VLM)在自动驾驶方面具有先进的高级推理能力,但人们对它们将这种推理建立在自我运动的基础物理学基础上的能力仍然知之甚少。我们介绍了 EgoDyn-Bench [项目页面:(https://tum-avs.github.io/EgoDyn-Bench-Website/),代码:(https://github.com/TUM-AVS/EgoDyn-Bench),数据集:(https://huggingface.co/datasets/fnc1901/EgoDyn-Bench)],这是一个用于评估以视觉为中心的基础模型的语义自我运动理解的诊断基准。通过确定性预言将连续车辆运动学映射到离散运动概念,我们将模型的内部物理逻辑与其视觉感知分离。我们对 20余个模型进行的大规模实证审计,包括闭源 MLLM、跨多个尺度的开源 VLM 和专门的 VLA,发现了一个重大的感知瓶颈:虽然模型展示了逻辑物理概念,但它们始终无法将其与视觉观察准确地对齐,经常表现不佳经典的非学习几何基线。这种失败在模型规模和特定领域的训练中持续存在,表明当前架构在将视觉感知与物理推理结合起来方面存在结构性缺陷。我们证明,提供明确的轨迹编码基本上可以恢复所有评估模型的物理一致性,揭示视觉和语言之间的功能分离:自我运动逻辑几乎完全来自语言模态,而视觉观察贡献的时间信号可以忽略不计。这一结构发现提供了一个标准化的诊断框架和一条实现物理对齐的具体人工智能的实用途径。自我运动 - 物理推理 - 基础模型