论文

重新思考视觉忽视:通过情境偏好来缓解 MLLM 幻觉

Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation

模型推理解码与生成控制

摘要

物体幻觉仍然是多模式 大语言模型 (MLLM) 可靠部署的主要障碍。目前的推理时间缓解方法主要假设幻觉源于视觉忽视,转向模型以增强视觉依赖性。相比之下,我们对多个 MLLM 的系统干预表明,推动更多的视觉依赖可能会加剧某些模型的幻觉,而较少的视觉依赖可能会减轻幻觉。这一结果表明,将幻觉仅仅归因于视觉不足的说法尚不明确。我们认为,图像作为上下文,同时与模型的参数知识和文本上下文竞争。为此,我们提出了一个 无需训练 框架,即上下文偏好激活引导(CAS)。它通过两小组设计的冲突样本提取两个语义上不同的上下文偏好向量 (CPV),并在推理过程中通过单通道带符号残差注入在中早期 MLP 层应用它们,以控制信息依赖。实验表明,CAS 可以在不增加解码延迟的情况下显着减轻物体幻觉,并保持本机文本生成质量。