论文
视觉语言模型推理中的视觉访问边界
Visual Access Boundaries in Vision-Language Model Reasoning
摘要
思维链(CoT)提示被广泛用作视觉语言模型(VLM)的测试时扩展策略,但VLM生成更长推理轨迹时究竟扩展了什么仍不清楚。我们追问:CoT是否需要对图像token的持续访问,还是主要在早先前向传播中已提供的视觉信息上运作。我们引入视觉访问扫描——沿层深与生成时间掩蔽生成token查询对图像token键的注意力——并把视觉访问边界(VAB)定义为保持任务准确率的最小访问区域。跨Qwen2.5-VL与InternVL3的六种模型配置:无CoT直接作答与CoT提示都呈现有限VAB。在Qwen2.5-VL-32B与InternVL3(14B与38B)上:当CoT对照无CoT全访问目标评估时,其VAB层与无CoT边界相差至多两层——尽管生成大幅更长。这提示CoT并非主要靠延长推理轨迹中直接的图像token访问来改善表现,而是靠扩展针对图像派生隐状态信息的语言侧计算。我们进一步显示CoT增益受感知读出约束:被查询的视觉属性能被模型可靠读出时CoT有效,读出不可靠时无效。符号属性预言机显示:真值属性以文本提供时CoT能改善计数;单物体探针对解码检查显示困难属性可从隐状态线性恢复、模型自身却难以输出。这些分析把瓶颈定位在读出而非计数。
