论文

视觉语言模型推理中的视觉访问边界

Visual Access Boundaries in Vision-Language Model Reasoning

模型评测模型行为与机制分析

摘要

思维链(CoT)提示被广泛用作视觉语言模型(VLM)的测试时扩展策略,但VLM生成更长推理轨迹时究竟扩展了什么仍不清楚。我们追问:CoT是否需要对图像token的持续访问,还是主要在早先前向传播中已提供的视觉信息上运作。我们引入视觉访问扫描——沿层深与生成时间掩蔽生成token查询对图像token键的注意力——并把视觉访问边界(VAB)定义为保持任务准确率的最小访问区域。跨Qwen2.5-VL与InternVL3的六种模型配置:无CoT直接作答与CoT提示都呈现有限VAB。在Qwen2.5-VL-32B与InternVL3(14B与38B)上:当CoT对照无CoT全访问目标评估时,其VAB层与无CoT边界相差至多两层——尽管生成大幅更长。这提示CoT并非主要靠延长推理轨迹中直接的图像token访问来改善表现,而是靠扩展针对图像派生隐状态信息的语言侧计算。我们进一步显示CoT增益受感知读出约束:被查询的视觉属性能被模型可靠读出时CoT有效,读出不可靠时无效。符号属性预言机显示:真值属性以文本提供时CoT能改善计数;单物体探针对解码检查显示困难属性可从隐状态线性恢复、模型自身却难以输出。这些分析把瓶颈定位在读出而非计数。

视觉语言模型推理中的视觉访问边界:论文配图
图 1:视觉访问扫描和视觉访问边界的概述。 (a) 视觉访问扫描。在每个扫描点 (tcutoff,ℓcutoff)(t_{\text{cutoff}},\ell_{\text{cutoff}}),我们仅允许满足 t≤tcutofft\leq t_{\text{cutoff}} 的生成令牌查询和满足 ℓ≤ℓcutoff\ell\leq\ell_{\text{cutoff}} 的层直接访问图像令牌。在这个允许的矩形之外,从生成的令牌查询到图像令牌键的注意力被屏蔽。视觉访问边界 (VAB) 是在容差 ϵ\epsilon 内保持精度的最小访问对 (ℓ*,τ*)(\ell^{*},\tau^{*})。 (b) 主要结果。在直接提示下,删除后面的层几乎不会影响准确性,识别深度 ℓ*\ell^{*} ,超过该深度,继续直接图像令牌访问在功能上是多余的。在 CoT 提示下,尽管生成的令牌计数要大得多,但 VAB 区域仍被保留,这表明扩展的语言端推理不需要扩展的直接图像令牌访问。