论文

敢于减轻幻觉:双路径自动回归感知编辑

DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing

模型推理解码与生成控制

摘要

大型视觉语言模型(LVLM)最近在多模态任务中取得了显着的进展,但物体幻觉仍然是一个持续的挑战,模型生成与视觉输入不一致的描述。最近的工作通过免训练的表示编辑来减轻幻觉,通常是通过教师强制(TF)幻觉和真实反应之间的对比来构建与幻觉相关的方向。然而,LVLM 在生成过程中通过自回归 (AR) 解码进行操作,这就提出了基于 TF 的分析是否完全反映了导致幻觉输出的生成动态的问题。在本文中,我们分析了基于 TF 的编辑和 AR 生成行为之间的关系,发现仅基于 TF 的编辑可能不足以捕获与幻觉相关的解码动态和多模态交互。为了解决这个限制,我们提出了 DARE(双路径自回归感知编辑),这是一种混合幻觉编辑框架,集成了两个互补的对比路径:文本对比和图像对比,以及自回归感知表示信号。具体来说,DARE 根据 (1) 基于 TF 的文本对比、(2) 解码期间的 AR 感知表示转换以及 (3) 配对图像之间受控的视觉差异构建幻觉编辑方向。对多个 LVLM 幻觉基准的大量实验表明,DARE 能够持续减少物体幻觉,同时保留多模态感知能力和推理效率。我们的实现代码可在 https://github.com/KU-VGI/DARE. 获取