论文
MM-Snowball:评估和减轻多模式多轮对话中的幻觉滚雪球
MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue
摘要
多模态 大语言模型 (MLLM) 表现出卓越的视觉理解能力,但它们在交互环境中的可靠性却因幻觉滚雪球而严重受损:这种现象是初始错误在会话过程中放大,导致连贯性崩溃。这一失败揭示了一个根本性的漏洞,即模型逐渐忽视视觉基础,转而过度依赖受污染的文本历史。现有的基准测试主要局限于单轮 VQA,无法捕捉长范围交互中错误传播的复杂动态。为了解决这个问题,我们引入了 MM-Snowball,这是第一个对对话中幻觉滚雪球进行细粒度诊断的基准。广泛的评估表明,我们的基准测试甚至对先进的 MLLM 也构成了重大挑战,并揭示了为单轮 VQA 设计的现有缓解方法的低效性。为了抵消这种退化,我们提出了冲突感知视觉纠正(CAVR)。这种 无需训练 方法通过协同双重机制减轻滚雪球效应,该机制刷新表示级别的视觉基础并纠正 logits 级别的输出分布,从而有效地将模型重新锚定到视觉事实。实验表明 CAVR 实现了最先进的性能,为更可靠的交互式人工智能提供了一条有希望的道路。数据和代码可在以下位置获取:https://frenkie-chiang.github.io/MM-Snowball