论文

观看并非解决:审核对冻结视觉几何的语言访问

Seeing Is Not Addressing: Auditing Linguistic Access to Frozen Visual Geometry

模型评测模型行为与机制分析

摘要

视觉上的区别通常比语言概念化中反映的区别更精细。视觉语言模型表现出类似的不对称性:在冻结图像几何形状中,区别可以保持可辨别性,同时通过本机文本界面很难寻址。我们通过在文本到图像检索中将视觉可辨别性与语言可寻址性分开来研究这一差距。 FactorAtlas 是一个完全交叉的测试平台,包含 23,040 张图像,涵盖形状、色调、图案和干扰变化,我们比较了具有相同区别的保留图像的两个读数。然后,我们得出图像侧对比度,将每个值与其替代值分开,以实现匹配的视觉基础,并测试这是否会减少因素和模型之间的本机文本访问差距。特定方向和视觉缺失控制将这些增益与相关视觉对比度联系起来;在全局对齐后,收益仍然存在,并扩展到合成检索和自然图像。总之,这些结果表明视觉可辨别性和语言可寻址性不需要一致,并且匹配的视觉基础可以探测并减少由此产生的访问差距。