论文
HalluScope:多模态细粒度幻觉诊断 大语言模型
HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models
摘要
尽管多模态 大语言模型 在广泛的视觉语言任务中取得了出色的性能,但它们仍然存在幻觉,即模型输出与视觉内容、文本上下文或常识知识不一致。现有的研究主要通过粗粒度检测来解决这个问题。然而,这些方法通常无法提供足够的诊断信息来了解幻觉类型并支持下游幻觉缓解。为了弥补这一差距,我们提出了 MLLM 的细粒度幻觉诊断,这是一项新的统一任务,可以联合执行幻觉检测、分类和可解释的解释生成。我们开发了一个自动化数据生成管道并构建了 HalluScope-30K,这是一个涵盖八个来源和五个任务类别的大规模诊断数据集。基于该数据集,我们设计了一个多粒度联合奖励函数并训练了两个诊断模型 HalluScope-4B 和 HalluScope-8B,它们在 MHALO 基准和我们的细粒度幻觉分类基准上都实现了最先进的性能。值得注意的是,检测和分类在联合优化下是互惠互利的。此外,诊断驱动的反馈实验表明,我们的模型产生的细粒度诊断解释有效地指导目标模型纠正其幻觉,全面诊断大大优于 Qwen3-VL-8B-Instruct 和 LLaVA-1.5-7B 上的所有基线。我们的代码、数据和模型可在 https://github.com/wkinglin/HalluScope 获取。