论文

视觉信息在视觉-语言-动作模型驾驶行为中起着决定性作用吗?

Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?

模型评测鲁棒性、公平性与可信度评测

摘要

视觉-语言-动作(VLA)模型在自动驾驶方面表现出了良好的能力,凸显了统一多模态架构在联合建模感知和规划方面的潜力。然而,目前基于 VLA 的驾驶行为如何基于视觉信息仍然知之甚少。现有的评估协议主要关注总体性能指标,缺乏结构化和实用的诊断来量化视觉行为依赖性。在这项工作中,我们引入了一个结构化的多级视觉扰动框架来系统地分析基于 VLA 的驾驶模型中的视觉行为依赖性。该框架沿着三个互补的维度组织受控的视觉扰动:通道级退化、信息级破坏和结构级修改。我们将其应用于基于 VLA 的驾驶系统,并评估开环轨迹预测和交互式闭环安全评估下的行为响应。实验结果揭示了依赖于评估的依赖模式和跨抽象级别的不均匀视觉基础。这些发现需要对 VLA 驾驶模型进行更结构化的分析和原则性设计,以更好地了解视觉信息如何塑造行为并开发更安全、更强大的系统。