论文

VLM 图表读取内部:跨空间和深度追踪垂直条形图的值读取

Inside VLM Chart Reading: Tracing Value Reading from Vertical Bar Charts Across Space and Depth

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 可以准确回答图表问题,但输出准确性并不能显示它们如何结合恢复精确值所需的证据。我们研究了 Qwen2.5VL-7B-Instruct 和 InternVL3.5-8B 中受控反事实激活补丁的垂直条值读取。该研究连接了三个分析:(1)单因素结果表明,尽管包含较少的视觉标记,但更改后的栏顶部区域比未更改的栏主体恢复了更多的答案偏好。图例和系列相关状态也比条形几何和轴尺度状态更早失去局部可恢复性。 (2)在切换分析中,恢复从早期层的视觉图例区域转移到中间层的提示系列位置。有选择地重置提示系列状态可以减少图例源救援,支持其作为部分调解者的角色。 (3) 在因子分析中,两种模型都可以使用来自单独捐助者的几何和尺度状态来支持组合目标。当状态来自单独的供体或一张图像时,InternVL 的表现类似,而 Qwen 对单独供体的恢复效果较低,这表明上下文敏感性较高。总之,这些结果为本地化支持精确柱值读数的内部计算提供了初步的因果证据。