多跳需求追溯中检索增强生成的三重稳健性分析
A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability
摘要
所报告的关于 GraphRAG 与向量 RAG 的结论不一致,证据通常与单个语料库、嵌入器和判断相关,而且我们表明,与测量引文质量的位置相关。我们提出了一个三重稳健性分析,该分析保持五管道架构矩阵固定并变化嵌入器(本地 e5-small 与 Azure text-embedding-3-small)、语料库(DO-178C 类型边缘要求与通过 MuSiQue 的维基百科段落链)和判断(两个语料库上配对的 GPT-5.4 x GPT-4.1),超过 2x4,440 个主矩阵运行, 600 次跨语料库运行,超过 5,000 次 忠实性 判断。 (C2a) GraphRAG 的图遍历以 0.12-0.23 的精度淹没上下文窗口,但合成器以 0.48-0.65 的精度选择性引用;将检索到的集合作为归因集进行评分会反转体系结构排名,从而协调了之前报告中的部分分歧。 (C1) 答案级引文获胜者受语料库和层条件限制,但嵌入器具有鲁棒性:GraphRAG 在短跳 DO-178C 查询上与普通版本联系在一起,并赢得每个 MuSiQue 层,而代理管道仅在 3+ 跳要求查询上领先。 (C2b) 忠实性 是语料库条件的:在 DO-178C 上,它随着跳跃距离而下降(四个判断 x 嵌入器组合中的三个的趋势 p<0.05);在维基百科链上,两位法官都没有表现出崩溃。 (C3) 单法官 LLM 忠实性 对检索状态很脆弱:GPT-5.4 跨嵌入器的自我 kappa 为 0.137(41% 判决变化),而当天的重测下限为 0.76,并且在 11 周后重新判断冻结输入,两个法官的 kappa <= 0.14。仅在密集嵌入上学习的路由器在跳分类(C4)上就达到了宏 F1 0.86。我们认为,RAG 架构声明应该在这种稳健性水平上进行测试——包括对引用测量点的稳健性——然后才能被信任。