论文
超越语言先验:多模式中诊断和修复视觉源幻觉 LLM
Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM
摘要
现有的多模态 大语言模型 (MLLM) 物体幻觉研究主要将问题归因于语言先验,例如过度依赖文本共现统计。我们通过提供定量证据来挑战这一观点,以证明一个互补的、尚未充分探索的原因:视觉起源幻觉,其中幻觉是由不正确的视觉特征提取以及图像和文本嵌入之间的错位引起的。通过余弦相似度分析和 Smooth Grad-CAM 熵测量,我们发现幻觉样本表现出系统性较低的图像文本相似度(平均 0.158 与 -0.122)和倒置的注意力模式,其中当目标对象存在时注意力分散,但当目标对象不存在时注意力错误地集中。以此诊断为指导,我们提出对抗性对比 微调 (ACFT)。 ACFT 使用对抗性幻觉属性翻转 (AHAF) 程序,涉及翻转图像幻觉属性的最小的、有针对性的对抗性扰动,以构建完美对齐的正负对,然后将其用于对比 微调。 AHAF 同时充当诊断探针,揭示 MLLM 视觉表征非常接近幻觉决策边界。 ACFT 仅需要 0.9% 的 COCO 数据集并添加零推理开销,在 POPE、MME 以及 LLaVA、MiniGPT-4 和 Qwen2.5-VL 的四个描述级幻觉基准上实现了最先进的性能。代码可在 https://github.com/zxp555/ACFT_MM 获取