论文
当语言覆盖视觉时:视觉语言模型中的过度对齐和几何去偏差
When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models
摘要
视觉语言模型 (VLM) 越来越多地为从医学成像到自主系统的高风险应用提供支持,但它们经常产生幻觉,自信地描述输入中不存在的内容。我们通过针对基于解码器的 VLM 的机制分析来调查这些故障模式的根本原因。我们将这些失败模式追溯到几何过度对齐:为了弥合注意力机制所需的模态差距,基于解码器的 VLM 将视觉嵌入与文本流形过度对齐,注入统计语言偏差,系统性地掩盖了细粒度的视觉证据。虽然之前的工作要么积极缩小这一差距,要么通过昂贵的黑盒解码策略抑制幻觉,但没有解决根本的几何原因。我们提供了这种过度对齐的第一个定量特征,证明语言偏差集中在通用的、与数据集无关的文本子空间的顶部主要组成部分。基于这一见解,我们提出了两种互补的补救措施:无需训练 推理策略和偏见感知 微调 范例,两者都从视觉表示中明确地投影出该子空间。我们的方法显着减少了 POPE、CHAIR 和 AMBER 基准的幻觉,并提高了长格式字幕任务的 CLAIR 分数,无需训练 变体在基本模型上没有增加任何计算开销。