论文

超越全局编辑:LVLM 中 无需训练 幻觉缓解的按实例解缠结子空间

Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

模型推理解码与生成控制

摘要

大型视觉语言模型 (LVLM) 的最新进展通过将视觉编码器与 大语言模型 (LLM) 集成,实现了强大的多模式推理。然而,它们的可靠性经常受到幻觉的破坏,其中生成的文本不准确地描述了视觉输入。尽管 微调 可以缓解这个问题,但它的计算成本很高,并且需要大型、精心策划的数据集,这使得 无需训练 替代方案很有吸引力。其中,模型编辑比基于解码的方法更有前途:解码方法会调整每个输入的输出,但会引入计算开销和不稳定性,而模型编辑会离线修改内部表示,从而提供更高效、更稳定的解决方案。然而,现有的模型编辑技术通常依赖于单个全局子空间来纠正幻觉,对所有测试样本进行相同的处理,并且无法跨输入捕获不同的幻觉模式。为了解决这个限制,我们提出了一个 无需训练 幻觉缓解框架,用于在测试时动态地抑制每个实例。我们的方法首先构建一组解开的幻觉子空间,每个子空间隔离一个不同的幻觉模式。在推理过程中,模型自适应地计算反映每个输入与这些子空间的关系的权重,引导动态组合投影,选择性地抑制最可能的幻觉方向,同时保留基于图像的语义。跨多个视觉语言基准和 LVLM 系列的广泛实验证明了一致的改进,突出了我们方法的稳健性、通用性和效率。