论文
锚定,不分级:视觉语言模型在倾斜纹理感知方面失败
Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception
摘要
人类对纹理表面倾斜的感知表现出系统的、分级的偏差,这些偏差在心理物理学实验中可靠地出现。之前的研究表明,无监督 CNN 会产生一些类似人类的偏见,而有监督 CNN 则不会。视觉语言模型 (VLM) 是否表现出类似的能力?在多个 VLM 系列和模型尺度中,零样本和上下文提示都会产生明显的失败:仅在一小部分锚点处预测倾斜(例如,0\度、$\pm$25\度、$\pm$45\度),几乎不依赖于刺激视场、光学倾斜或表面曲率。受监督的 微调 部分修复了故障,但残余锚定仍然存在。虽然高级视觉语言基准测试的成功可能不需要对底层几何线索敏感,但我们将锚定解释为表示到输出语言接口的失败:不一定缺乏几何编码,而是未能以分级形式表达它。