论文

VLADriveBench:评估自动驾驶 VLA 中的 CoT-Action 关系

VLADriveBench: Evaluating CoT-Action Relationship in VLA for Autonomous Driving

模型评测基准与评测资源

摘要

视觉-语言-动作 (VLA) 模型会与驾驶轨迹一起生成思想链 (CoT) 推理,但现有基准仅评估轨迹质量,而不会评估 CoT 是否与驾驶动作相关、一致或存在因果关系。我们引入了 VLADriveBench,这是一个将观察指标(提及、幻觉、矛盾、行动一致性)与 CoT 干预协议相结合的框架,以提供 CoT 与行动关系的补充视图。将 VLADriveBench 应用于两种架构的三个模型,我们发现这两种分析可能存在很大分歧:ORION 在观察对齐方面得分最高,但其 CoT 是副现象,而 Alpamayo v1.5 得分较低,但其 CoT 具有很强的因果关系,视觉显着性控制了 CoT 影响的程度。