论文

VLA推理可靠吗?探索因果链的安全性

Is VLA Reasoning Faithful? Probing Safety of Chain-of-Causation

模型评测安全与风险评测

摘要

我们提出首个针对视觉-语言-动作(VLA)驾驶模型忠实性的系统研究,分析了100个多样化PhysicalAI-AV场景中300次Alpamayo-R1-10B推理。我们的主要发现是,输出的自然语言理由与轨迹可能显著不忠实:(i) 总体推理保真度仅42.5%,Chain-of-Causation与场景现实吻合的情况不到一半;(ii) 在三分之一的行人相关场景中漏检94名行人;(iii) 轻微视觉扰动下轨迹脆弱率达97.7%;(iv) 推理-动作平均一致性仅48.3%,53.3%的推理呈现低一致性,其中包括37.9%声称停车的案例中模型实际继续行驶。我们以信息论方式形式化忠实性,定义了带验证准则的实体保真度和动作保真度,并勾勒出与这些结果相符的四组件安全架构。