论文
Grid2Matrix:揭示视觉语言模型中的数字失认症
Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models
摘要
视觉语言模型 (VLM) 在许多多模态推理基准上表现出色,但这些评估通常不需要详尽地读出图像,因此可能会掩盖忠实捕获所有视觉细节的失败。我们引入了 Grid2Matrix (G2M),这是一种受控基准,其中向模型显示颜色网格和颜色到数字的映射,并且必须输出相应的矩阵。通过改变网格大小和颜色数量,G2M 提供了一种简单的方法来增加视觉复杂性,同时最大限度地减少语义混淆。我们发现 VLM 在零样本端到端评估中表现出急剧的早期崩溃,在令人惊讶的小网格上失败,而不是随着任务变得更加密集而逐渐退化。我们探索了两个代表性系列的 VLM 的视觉编码器,发现它们比相应的端到端输出保留了更多的网格信息。这表明这种失败不仅仅可以用视觉编码来解释,而且还反映了从视觉特征中可恢复的内容与最终用语言表达的内容之间的差距。我们将这种差距称为\textit{数字失认症}。进一步的分析表明,这些错误是高度结构化的,并且很大程度上取决于网格单元与视觉块边界的重叠方式。我们还发现模型缩放和多模态对齐等常见策略并不能完全消除这种故障模式。我们希望 G2M 能够作为一个有用的测试平台,用于了解 VLM 在何处以及如何丢失精细的视觉细节,并评估丢失甚至很小的视觉细节可能很重要的任务,例如表格、图表、表单和 GUI。