论文

大型视觉语言模型中的幻觉感知中间表示编辑

Hallucination-aware intermediate representation edit in large vision-language models

模型训练模型编辑与遗忘

摘要

大型视觉语言模型在多模态推理和复杂场景理解方面表现出了卓越的性能。然而,这些模型仍然面临严重的幻觉问题,输出与视觉事实相矛盾。最近关于缓解幻觉的研究主要集中在再训练方法和对比解码(CD)方法上。虽然这两种方法都表现良好,但重新训练方法需要大量的训练资源,并且 CD 方法会引入双重推理开销。这些因素阻碍了它们的实际应用。为了解决上述问题,我们提出了一个动态检测幻觉表征并对这些表征进行幻觉消除编辑的框架。以最小的额外计算成本,我们在现有基准上实现了最先进的性能。大量的实验证明了我们的方法的有效性,突出了其高效、强大的幻觉消除能力以及对幻觉的强大可控性。代码可在 https://github.com/ASGO-MM/HIRE 获取