论文

零射击视觉语言控制中的视觉基础

Visual Grounding in Zero-Shot Vision-Language Control

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)越来越多地被用作零样本控制器,但成功执行不一定说明决策基于视觉输入:模拟器动力学和保守动作先验,也可能在缺少有效感知时取得良好分数。本文通过一组输入消融检查研究这一问题,包括屏蔽图像、重复相同输入、沿车道轴镜像、非视觉基线和处理流程完整性检查。对九个直接动作模型、六个结构化本地VLM和一个探索性VLM-MPC层级系统,在两类具身平台和三个模拟器中共分析32874次评分调用。直接控制结果主要为负面:恒定SLOW策略优于脚本化几何控制器;多个模型不受图像影响或输出近乎恒定;能识别纵向危险的模型,仍无法在镜像后交换LEFT与RIGHT。没有本地VLM同时满足纵向和横向视觉依据标准。不过,仅用图像的确定性正对照能够以0.090米平均绝对误差估计前车距离,并严格满足镜像等变性,说明输入包含足够视觉信息,失败局限于具体模块。在控制信息泄漏的事后分析中,对称共识守护模块根据16帧校准图像选出两个模型,并固定原图与镜像图上的四票取二危险判定。在272帧留出图像上,平衡准确率为0.954,按回合聚类自助法估计的95%置信区间为[0.895,0.990];嵌套逐回合留一验证在全部12折选出相同模型组合和阈值。平票时弃答,使已作答部分的平衡准确率升至0.973,覆盖率为0.824。由确定性感知保留横向控制权时,离线模块化重放的动作一致性为0.934,并严格满足镜像等变性。结果支持将当前VLM作为能力受限、选择性介入的危险辅助模块,而非统一的零样本控制器。