论文
盲点速度:自动驾驶 VLM 动态感知的可解释性分析
Speed in the Blind Spot: An Interpretability Analysis of Dynamic Perception in VLMs for Autonomous Driving
摘要
视觉语言模型越来越多地用于自动驾驶系统,但其从视觉输入恢复动态物理状态的能力仍然没有得到充分表征。我们研究速度理解作为跨三个任务的受控诊断:周围智能体速度、当前自我速度和短期未来自我速度建议。在 nuScenes 上,我们使用多个输入和输出公式评估开放式通用和 PhysicalAI VLM,以及面向驾驶的 Alpamayo-1.5 视觉-语言-动作模型。我们将言语评价与时间扰动、反事实的自我速度提示和隐藏表征的线性探测结合起来。这些任务表现出不同的故障模式。周围Agent速度以Agent特定形式弱编码,而当前自我速度通常可以在内部访问,但很难用语言表达:连续探测实现 4.7-5.8 km/h MAE,而语言输出的 MAE 为 10.2-16.8 km/h。多个帧为单帧输入提供不一致的语言增益,并且帧顺序很少被利用。在非优化的 QLoRA 下,特定任务的适应改善了与任务相关的潜在速度表示和口头读出,但连续的周围Agent速度估计仍然很弱,而大多数未来速度增益在帧洗牌中幸存下来,表明时间基础有限。驾驶专门的 Alpamayo-1.5 显示出对周围智能体和未来自我速度的更强的潜在表征,而当前自我速度的可解码性是可比的,并且仍然存在大量的探测语言差距。因此,驾驶专业化可以增强运动表征,但不能保证场景和自我状态之间更强的编码或可靠的读出。结果表明,合理的规划输出并不一定意味着潜在动态的可靠恢复或暂时基础。