论文
读出失明:VLM分数错过了冻结编码器保留的空间方向
Readout Blindness: VLM Scores Miss the Spatial Direction Their Frozen Encoders Retain
摘要
类似 CLIP 的视觉语言模型仍然是多模态系统的基石,但它们在定向空间关系上的得分仍然是接近随机水平,例如一个物体是否离开另一个物体。我们将这种失败称为读出盲目性,并从理论上和经验上分析为什么部署的分数会丢失方向:当评分规则对称地对待主体和客体时,无论编码器训练是什么,方向都会取消。在此分析的指导下,我们引入了反对称位移读出 (ADR),它将标题文字与冻结特征中的图像块对齐,并通过匹配对象质心之间的有符号位移对每个关系进行评分。值得注意的是,ADR 无需额外的训练或学习的参数即可成功,从而证明方向信息保留在冻结的编码器中。然而,文本和世界先验可能会提高准确性,因此我们进一步引入先验通货紧缩,它衡量图像-文本配对的好处,作为将每个项目与不相关图像配对的零值的视觉定位增益。跨编码器系列的广泛实验表明,ADR 大大提高了部署的分数,即使对于微调编码器,在大多数方向平衡集上仍保持接近随机水平。与更复杂的读出相比,ADR 优于评估的MLLM可能性读出,并且在一小部分计算量上与聊天推理具有竞争力。这些结果支持我们的主张,即可以通过适当的读出从冻结特征中恢复方向信息。我们的实施和评估工具包将公开提供。
