论文
通过隐式特征稳定减轻大视觉语言模型的幻觉
Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization
摘要
大视觉语言模型 (LVLM) 很容易产生幻觉:它们流畅地描述图像中不存在的对象、属性和场景。我们将这种失败的部分原因与它们的表示的可测量属性(特征不稳定性)联系起来,其中输入的轻微语义保留扰动会导致学习到的嵌入发生巨大变化;幻觉率随着这种变化而上升。现有的以稳定性为动机的补救措施是明确的,因为它们通过潜在转向或约束解码在推理时间进行干预,并在每个查询上付出代价。我们建议改为隐式稳定:在 微调 期间将扰动不变性内置到模型权重中,并且在部署时没有任何额外运行。我们的框架 INFUSE 首先稳定扰动平均和 真值 锚点周围的视觉和文本表示,然后将跨模式的稳定表示与双向对比目标对齐。我们证明锚点与扰动均值表示的均方根偏差在视图数量中以 $1/\sqrt{K}$ 的速率缩小,并且在 Lipschitz 解码器下,这限制了任何扰动可以改变模型的幻觉行为的程度。在 LLaVA-1.5、LLaVA-1.6 和 Qwen3-VL-8B-Instruct 上,INFUSE 相对于每个基本模型将 AMBER CHAIR 减少了 46-63%,改进了 ObjHal、MMHal、HallusionBench 和 POPE,并保留了 VQA-v2 和 TextVQA,所有这些都没有推理时间开销。