论文

视觉语言模型中长文本图像文本一致性的人性化校准

Human-Grounded Calibration for Long-Text Image-Text Congruence in Vision-Language Models

模型评测评测方法与指标

摘要

长文本图像-文本一致性评分对于必须评估详细文本描述是否与视觉内容匹配的视觉语言系统越来越重要。然而,双编码器模型的原始相似性分数很难解释为校准的一致性度量,特别是在图像和文本嵌入之间的模态差距下。本文提出了一致性得分(CS),这是一种轻量级校准层,可将图像-文本相似性证据映射到有界得分。使用 DOCCI 和 Urban1k,我们评估了四种冻结的视觉语言主干,并表明观察到的投影后质心距离的减小并不能统一提高图像文本检索性能。对 DOCCI 的人性化评估进一步揭示了一种权衡:直接事后校准保留了与人类判断的高度关联,而选定的基于投影的配置可以减少与阈值相关的斜率和截距失真,但代价是检索性能和关联强度。这些结果将长文本图像-文本一致性评分建立为校准的分数估计问题,其中检索性能、人类关联和阈值校准必须作为不同的目标进行评估。 CS 提供了一种轻量级的方法来公开和操作这种分离。