论文
从抑制到修复:通过局部分布对齐减轻大视觉语言模型中的物体幻觉
From Suppression to Repair: Mitigating Object Hallucination in Large Vision-Language Models via Localized Distribution Alignment
摘要
物体幻觉仍然是大型视觉语言模型(LVLM)生成可靠内容的主要障碍。一种直观的缓解策略是抑制隐藏表示中与幻觉相关的成分。然而,这些组件也可能包含有用的信息,抑制它们会削弱模型的多模态能力。在本文中,我们提出了 ResOT,这是一种无需训练的方法,可通过局部分布对齐在推理时修复表示。具体来说,ResOT 将主要的幻觉方向投射到远离忠实子空间的位置,形成用于干预的低维残余子空间。在这个子空间中,ResOT 使用高斯最优传输 (OT) 将幻觉分布与真实分布对齐。生成的地图定义了修复目标,并对原始表示进行了最小的更改。在推理时,ResOT 自适应地控制每个token状态向其 OT 目标移动的距离。对三个代表性 LVLM 的实验表明,ResOT 显着减少了物体幻觉,同时改善了图像 跨多个基准的字幕质量和多模式性能。代码将被发布。