论文
RAG 知道检索错误吗?诊断知识冲突下的上下文合规性
Does RAG Know When Retrieval Is Wrong? Diagnosing Context Compliance under Knowledge Conflict
摘要
检索增强生成(RAG)通常通过最终答案是否正确来评估。在知识冲突下,这隐藏了一个关键问题:模型是否遵循检索到的证据,依赖其参数先验,还是产生事后理由?我们将其研究为上下文合规性,即检索到的上下文控制答案的机制,即使它与模型的先验知识相冲突。我们引入了上下文驱动分解(CDD),这是一种推理时间诊断干预,可以引出上下文和先前的答案,隔离冲突的前提,并记录可能受到干扰的解析跟踪。在 Epi-Scale 压力测试、TruthfulQA 错误概念注入和跨模型重运行中,CDD 使三种行为变得可见。首先,误导性检索会严重降低准确性:在最坏情况下,TruthfulQA 错误概念注入探测下,标准 RAG 仅达到 15.0%。其次,更好的答案不需要共享相同的机制:CDD 提高了 Gemini-2.5-Flash 上的对抗精度,并显示了 Claude 变体的方向增益,但痕迹扰动灵敏度仅在 Gemini 上较高。第三,与局部事实冲突的冲突感知指令基线相比,显式分解提高了受控冲突的鲁棒性,实体交换(88.0% vs 79.3%)和逻辑矛盾(83.2% vs 75.4%)的边界最明显。我们将 RAG 冲突处理视为可观察性问题。