论文

通用病理学、条件后果:用于多跳可追溯性的 RAG 三重鲁棒性分析

Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability

模型评测鲁棒性、公平性与可信度评测

摘要

在许多报告中,GraphRAG 在引用精度方面低于向量 RAG,但其位置和原因仍然受语料库限制。我们提出了一种三重鲁棒性分析,该分析保持检索架构固定,并在 4,440 次主矩阵运行、600 次运行中改变三个正交轴嵌入器(本地 e5-small -> Azure text-embedding-3-small)、语料库(DO-178C 类型边缘要求 -> 通过 MuSiQue 的维基百科段落链)和判断(配对 GPT-5.4 x GPT-4.1)跨语料库运行,以及 1,200 个配对的 忠实性 判断。 (C2a) 过度引用在架构上是通用的:GraphRAG 在所有三种设置中以引用精度 0.12-0.23 和检索召回 0.68-0.87 发出每个答案 11-15 个 ID。 (C2b) 它的 忠实性 结果是语料库条件的:在类型边缘 DO-178C 中,GraphRAG 忠实性 跨跳崩溃了 74%->40%;在维基百科链上,相同的管道上升了 42%->58%,因为过度引用的段落仍然是主题支持。 (C1) 层条件获胜者是语料库条件的,但嵌入器稳健:vanilla 在 DO-178C 上赢得 2-hop,GraphRAG 在 MuSiQue 上赢得 2-hop,在任一嵌入器下都相同。 (C3) 单判断 LLM 忠实性 对检索状态很脆弱:对于 GPT-5.4,跨嵌入器的相同判断 self-kappa 为 0.137(41% 的项目的判断发生变化)。仅在密集嵌入上学习的路由器在跳分类(C4)上就达到了宏 F1 0.86。我们认为三重稳健性是值得信赖的 RAG 架构声明的最低标准。