论文

用于缓解 LVLM 幻觉的对抗性正交解开

Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation

模型推理解码与生成控制

摘要

大视觉语言模型 (LVLM) 具有先进的多模式理解能力,但其可靠性受到幻觉的限制,幻觉中生成的内容与视觉事实发生冲突。现有的缓解方法要么依赖于昂贵的外部干预,例如指令调整和检索,要么使用仍然受到有缺陷的注​​意力权重和纠缠隐藏表示的限制的内部机制。我们提出对抗正交解缠结(AOD),这是一种用于减轻 LVLM 幻觉的潜在几何框架。 AOD 通过极小极大目标学习与幻觉相关的方向:分类器将幻觉信号集中到投影分量中,而对手则通过梯度反转层将它们从正交残差空间中删除。学习到的方向可实现 无需训练 双前向通过对比解码策略,在保留一般功能的同时抑制幻觉。对四个幻觉和四个实用基准的三个 LVLM 进行的实验表明,AOD 始终优于强基准。它将 POPE 准确率平均提高了 6% 以上,将 AMBER 提高了 6%,并在 MMMU 等实用任务上保持了强劲的性能。进一步的分析显示了跨数据集的稳健传输,这表明 AOD 捕获了与幻觉相关的一般偏差,而不是数据集特定的伪影。我们的源代码和数据集可在 https://github.com/Hunter-Wrynn/AOD 获取。