论文
弥合缺失模态差距:改进视觉语言模型的纯文本校准
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
摘要
视觉语言模型 (VLM) 通常部署在纯文本输入上,尽管它们是使用图像进行训练的。我们发现,删除视觉模态会导致准确性大幅下降和严重的校准错误,并且模型在纯文本提示下的行为与其原始语言主干不同。这种失败不仅仅可以用缺少语义信息来解释。即使文本描述保留了关键内容,置信度也变得不可靠,而通过生成的图像添加视觉信号可以部分恢复准确性和校准。我们提出了潜在想象模块(LIM),这是一种轻量级交叉注意模块,可以根据文本输入预测想象的潜在嵌入,并将其输入到冻结的 VLM 主干中,而无需像素级图像合成。在纯文本基准、看不见的任务和丢失图像的场景中,LIM 提高了准确性并减少了校准误差。这些结果表明,潜在模态补全是模态缺失下可靠 VLM 推理的实用方法。