论文
VLM 跟踪而不跟踪:诊断视觉路径跟踪中的故障
VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following
摘要
视觉语言模型 (VLM) 在多模式基准上实现了强大的性能,但可能仍然缺乏对基本视觉操作的强大控制。我们研究\textit{线追踪},其中模型必须通过连续的局部延续遵循选定的视觉路径。为了隔离这种能力,我们设计了受控追踪任务,引入附近的竞争对手,同时减少语义和拓扑模糊性,例如交叉和重叠。在这些任务中,即使是最先进的 VLM 也经常会丢失目标路径并切换到附近的替代路径,尤其是当这些替代路径看起来与目标局部相似时。行为干预和内部分析表明,这些失败源于局部竞争:附近类似的干扰因素使模型偏离了真正的延续。标准补救措施并不能消除这个瓶颈:模型大小缩放仅提供有限的收益,推理通过昂贵的替代策略进行部分补偿,并且显式跟踪指令无法恢复稳定的路径跟踪。最后,对纠缠电缆场景和具有更丰富视觉复杂性的地铁地图的测试表明,相同的路径切换故障在我们的控制设置之外仍然存在。