论文

CARE Drive:评估自动驾驶中视觉语言模型理由响应性的框架

CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving

模型评测评测方法与指标

摘要

包括视觉语言模型在内的基础模型越来越多地用于自动驾驶,以解读场景、推荐动作并生成自然语言解释。然而现有评估方法主要考察结果性性能,如安全性和轨迹精度,而不判定模型决策是否反映人类相关的考量。因此,这些模型生成的解释究竟对应真正的理由响应性决策,还是仅仅事后合理化,仍不清楚。这一局限在安全攸关领域尤为严重,因为它可能制造虚假信心。为填补这一空白,我们提出 CARE Drive(Context Aware Reasons Evaluation for Driving),一个模型无关的框架,用于评估自动驾驶视觉语言模型的理由响应性。CARE Drive 在受控情境变化下比较基线与理由增强的模型决策,评估人类理由是否因果地影响决策行为。该框架采用两阶段评估流程:提示校准确保输出稳定;随后通过系统性情境扰动测量决策对安全裕度、社会压力和效率约束等人类理由的敏感度。我们在涉及相互竞争规范考量的自行车超车场景中演示 CARE Drive。结果显示,显式人类理由显著影响模型决策,提高与专家推荐行为的一致性。但响应性随情境因素而变化,表明对不同类型理由的敏感度不均。这些发现提供实证证据:基础模型的理由响应性可以在不修改模型参数的情况下被系统评估。

CARE Drive:评估自动驾驶中视觉语言模型理由响应性的框架
图1:用于评估伦理模糊驾驶场景中理由响应式VLM决策的CARE-Drive框架概览。左图展示了研究动机情境:相似的驾驶场景(例如禁止超车道路上的骑行者)可能引发相互冲突的理由(安全、合法性、舒适性、效率),导致是否超车存在模糊性。中图展示了视觉语言模型(VLM)如何接收场景表示S={V,O}(由视觉输入V与可观测上下文O组成),以及决策指令I(R,T,L),该指令规定注入的人类理由R、思维策略T和解释长度机制L。VLM产生带或不带人类理由(R=∅)的决策D_VLM,从而可以对基线行为与理由增强行为进行比较。右图描绘了CARE-Drive的两阶段评估流水线。在阶段1(Prompt Calibration)中,模型M与思维策略T被视为校准变量,目标是找出最优配置(M*,T*),使理由增强的VLM决策V_VLM^(+R)与专家参考决策D_AV之间的对齐最大化。在阶段2(Contextual Evaluation)中,校准后的配置(M*,T*)保持固定,并系统地改变可观测上下文O(例如与来车的碰撞时间、后方车辆的存在、乘客的紧迫程度),以测量注入人类理由的VLM在各情境中影响决策的敏感程度。底部蓝色箭头展示了CARE-Drive的核心成果:量化基线VLM决策、理由增强决策与专家判断之间的对齐程度。