论文

重新思考 CD:对比解码在减轻 MLLM 中物体幻觉方面无效性的再现性研究和扩展

Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs

模型推理解码与生成控制

摘要

对比解码 (CD) 已被提议作为 无需训练 策略,用于减轻多模态 大语言模型 (MLLM) 中的物体幻觉,并报告了 POPE 等基准测试的收益。然而,最近的研究质疑这些进步是否反映了视觉基础的真正改善。在这项研究中,我们重现并扩展了“性能增益的幻象:为什么对比解码无法减轻 MLLM 中的物体幻觉”的研究结果。具体来说,我们测试了 CD 会在判别数据集中引起单向输出分布变化的说法,并检查其在数据集中的普遍性。我们还验证了自适应合理性约束(APC)在判别基准和生成基准上将采样减少为贪婪搜索。除了繁殖之外,我们还严格研究 CD 在生成和判别数据集上的影响。我们进行了几个提供额外见解的实验:我们分析了生成数据集上不同 CD 策略引起的 logits 分布,提出一种代理方法并将其性能与 CD 技术进行比较,并研究幻觉信号如何通过专家和业余模型的每一层传播。使用 LLaVA 和 Qwen 在 MME、POPE 和 CHAIR 上进行的实验结果验证了最初的主张,并表明 CD 的明显改进通常是虚假的,并且不能始终转化为更强的视觉基础以减少幻觉。这些发现挑战了当前对比解码策略的有效性,并激励开发更可靠的方法来减轻 MLLM 中的幻觉。