论文

对于 VLM 来说,数到四仍然是一件苦差事

Counting to Four is still a Chore for VLMs

模型评测模型行为与机制分析

摘要

视觉语言模型 (VLM) 在复杂的多模态推理任务上取得了令人印象深刻的性能,但在对象计数等简单的基础技能上仍然失败。现有的评估大多仅评估最终输出,对模型中这些故障出现的位置提供的了解有限。在这项工作中,我们通过行为和机械分析对 VLM 计数行为进行了实证研究。我们推出了 COUNTINGTRICKS,这是一个基于简单形状的计数案例的受控评估套件,旨在暴露不同补丁布局和对抗性提示条件下的漏洞。使用注意力分析和组件式探测,我们表明,与计数相关的视觉证据在模态投影阶段最强,但在后面的语言层中大幅退化,其中模型变得更容易受到文本先验的影响。受这一发现的启发,我们进一步评估了模态注意力共享(MAS),这是一种轻量级干预措施,可在答案生成过程中鼓励最小的视觉注意力预算。我们的结果表明,VLM 中的计数失败不仅源于视觉感知限制,还源于语言阶段推理过程中视觉证据的充分利用。代码和数据集将在 https://github.com/leduy99/-CVPRW26-Modality-Attention-Share 发布。