论文

X-MADAM-RAG:检索增强生成中的中英文证据冲突的诊断和处理

X-MADAM-RAG: Diagnosing and Handling Chinese-English Evidence Conflict in Retrieval-Augmented Generation

模型评测基准与评测资源

摘要

检索增强生成(RAG)系统可能收到的证据不仅是嘈杂的,而且是相互矛盾的。这个问题在多语言环境中变得尤为突出,其中检索到的中文和英文证据可能支持不兼容的候选答案。我们通过 X-RAMDocs-ZHEN 研究这个问题,这是一个源自 RAMDocs 的受控中英文基准,用于诊断 RAG 中的证据冲突。该基准包含 6 个平衡条件下的 300 个示例,包括单语支持、双语协议、反向冲突方向以及与可选噪音的冲突。我们进一步研究了 X-MADAM-RAG,这是一个可解释的管道,它将证据处理分解为每个文档的候选提取、可见证据修复、确定性候选分组和冲突感知聚合。在使用 Qwen2.5-7B-Instruct 的原始受控基准上,X-MADAM-RAG 实现了 0.9667 严格准确度和 0.9767 冲突感知成功,优于证据归一化单调用基准。然而,仅零调用规则提取器在同一基准上达到 1.0000,揭示了强大的模板规律性。为了探究这个限制,我们构建了一个确定性的自然化压力测试,它删除了显式的答案模板,同时保留了候选字符串。在其 100 个样本子集中,仅规则提取下降至 0.0000,但 X-MADAM-RAG 的严格准确度也下降至 0.3000,低于朴素基线和证据标准化基线。特权预言机仍然完美,这表明文档级提取是主要瓶颈。这些发现将 X-RAMDocs-ZHEN 和 X-MADAM-RAG 定位为受控证据冲突的诊断工具,而不是作为一般幻觉检测或自然检索稳健性的证据。