论文
最后一个可见像素:探索视觉语言模型中的精细感知
The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models
摘要
最近的视觉语言模型(VLM)擅长多模态理解和推理,但它们的细粒度视觉感知仍未得到充分探索。 “草莓中有多少个 r?”的自然延伸会问:VLM 能够可靠地感知多小的视觉模式?因此,我们推出了 FineSightBench,这是一个新的基准测试,它通过在 4--48 像素的受控尺度上将感知任务(字母、形状、物体的像素级识别)与推理任务(空间推理、计数、对小目标进行排序)分开来系统地探索这一限制。通过对最先进模型的全面实验和详细故障模式分析,我们揭示了一种尖锐的分离:感知在 12px 左右饱和,而推理即使在更大的尺度上仍然受到限制,并且存在持续的计算和序列错误。这些发现暴露了 VLM 精细视觉推理的根本缺陷,需要更严格的评估。