论文
NumerosityVLM:解释视觉语言模型中数量表示的认知启发基准
NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models
摘要
视觉语言模型(VLM)在高级多模态任务上取得了出色的表现,但数字感知(人类婴儿在语言习得之前出现的一种认知能力)在当前模型中仍然知之甚少,因为现有的计数基准将数字与相关的视觉因素纠缠在一起。我们引入了一个认知启发的诊断基准 NumerosityVLM,包含六个受控条件下的 10,800 张合成图像。该基准正交地操纵对象大小、空间排列和数量,同时逐渐消融纹理、形状和颜色。在零样本设置下评估七个 VLM,多因素分析表明模型架构解释了最大比例的性能方差(部分 $ω^{2}=0.325$),远远超过了视觉条件。逐层探测进一步表明,线性可分离的数量信号始终出现在视觉编码器的早期阶段,而评估模型之间的性能差异主要与语言模型组件相关。代码和数据可在 https://github.com/fuy3/NumerosityVLM-Benchmark 和 https://huggingface.co/datasets/fuy3/NumerosityVLM 上公开获取。