论文
经检索增广取证缓解多模态系统中的视觉幻觉
Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference
摘要
多模态大语言模型(MLLM)在视觉语言理解和自然语言响应生成方面表现出了强大的能力。然而,这些系统仍然会产生过于自信的预测和类似幻觉的输出,特别是当视觉证据薄弱、模糊或语义不一致时。大多数现有方法侧重于改进多模态表示对齐或检索增强生成,同时提供有限的机制来量化实例级预测可靠性或识别不正确的视觉输出。这项工作提出了一种检索增强的可靠性感知推理框架,用于可信的多模态视觉理解。所提出的框架使用预训练的视觉嵌入和标准化特征表示的最近邻检索来构建外部视觉证据数据库。检索到的证据用于通过多个可靠性指标来估计预测的可信度,包括相似性强度、类别支持一致性、证据裕度、基于熵的不确定性和总体可靠性评分。根据这些信号,决策门确定系统是否应该接受预测、谨慎回答,或者在证据不足时放弃/回退。然后,多模态响应生成层根据可靠性决策生成最终的面向用户的响应。 ImageNet-100 上的实验表明,所提出的可靠性感知框架将可接受的预测精度从 85.84% 提高到 88.88%,覆盖率达到 89.04%。类幻觉接受错误答案率从 14.16\% 降低到 11.12\%。这些结果表明,整合检索证据、可靠性估计和选择性决策门控可以改进校准并减少过度自信的视觉错误,而无需重新训练大型多模态模型。
