论文
如何解决 RAG 故障?通过配对证据干预审计反事实反应
What Would Fix This RAG Failure? Auditing Counterfactual Response with Paired Evidence Interventions
摘要
失败的检索增强生成(RAG)答案可能与证据修复的几个看不见的反应一致。我们引入了 Pair-ID,这是一种离线审计,它保持一个查询、检索状态和读者不变,然后交叉两个操作,添加缺失的支持并删除已验证的不支持,以测量相同失败的反事实响应向量。超过 19,981 个基准查询的完整漏斗识别出 11,105 个合格的 Qwen 故障,前瞻性修复的 SHA-256 排序在生成任何采样响应之前从中选择 1,200 个。在1,190个重新生成有效的故障中,支持添加修复197/600个联合案例(0.328,95%CI [0.292,0.367]),以及删除修复162/1,190个案例(0.136,95%CI [0.117,0.155]);长度和位置匹配的假冒保留了 0.223 和 0.101 的语义对比。原始视图携带各个响应单元的部分预测信号(宏 AUROC 0.678;Brier 0.152 与边缘基线的 0.160),但精确矢量精度 0.637 不超过 0.646 多数矢量基线,矢量宏 F1 为 0.170。在四个读者中,两种边际敏感性都会重复出现,而汇总的精确向量一致性为 0.675-0.765,仅联合一致性降至 0.538-0.691。这些结果表明,在哈希选择的合格失败样本中,证据敏感性以有意义的比率出现,只能从观察到的失败中部分预测,并且以读者为条件。证据支持框架范围的离线响应审核,而不是信息论不可能结果、独立于读者的分类法或运行时修复策略。