论文

上下文成本:减轻多模态检索增强生成中的文本偏差

The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation

上下文与知识检索增强

摘要

虽然多模式 大语言模型 (MLLM) 越来越多地与检索增强生成 (RAG) 集成以减轻幻觉,但外部文档的引入可以隐藏实例级别的严重故障模式。我们识别并形式化了重新腐败现象,即使引入完全准确的“预言”上下文也会导致有能力的模型放弃最初正确的预测。通过对内部注意力矩阵的机械诊断,我们表明重新腐败是由两重注意力崩溃驱动的:(1)视觉失明,其特征是视觉注意力质量($M_{vis}$)和锐度($S_{vis}$)的系统性抑制;(2)结构位置偏差,迫使模型优先考虑边界标记而不是语义相关性。我们的分析揭示了成功的幻觉,表明许多看似正确的 RAG 结果仅仅是位置巧合,其中模型的文本复制偏差恰好与 真值 位置一致。为了解决这些漏洞,我们提出了恢复瓶颈注意力干预(BAIR),这是一种无参数的推理时间框架,可以恢复视觉显着性并对文本干扰项应用位置感知惩罚。在医学事实、社会公平和地理空间基准方面,BAIR 成功恢复了多模式基础并提高了诊断可靠性,而无需模型重新训练或 微调。