论文

SURE-RAG:选择性检索增强生成的充分性和不确定性感知证据验证

SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation

上下文与知识检索增强

摘要

检索增强生成(RAG)在检索到的段落中提供答案,但相关性并不能保证充分性:主题段落可能仍然无法证明答案的合理性。我们研究选择性 RAG 回答的证据充分性验证,其中验证者收到问题、候选答案并检索证据,并决定证据是否支持、反驳或不足以支持答案,只有在建立支持时才回答。我们提出了 SURE-RAG,一种将证据充分性视为集合级属性的聚合协议:通过独立对段落进行评分无法检测到缺失的跃点和未解决的冲突。共享的主张证据验证器为每个(主张、段落)对生成局部关系分布,SURE-RAG 将其聚合为四个可解释的答案级特征块(覆盖范围、关系强度、不确定性和检索),从而产生三向决策和可审核的选择性分数。我们在工件感知协议(快捷基线、反事实交换、无预言机检查和 GPT-4o 审计)下对 HotpotQA-RAG v3(一种受控多跳基准)进行评估。校准后的 SURE-RAG 达到 0.9075 Macro-F1(原始 0.8951 +/- 0.0069),远高于 DeBERTa 均值池(0.6516)和 GPT-4o 判断(0.7284),并且与强大的 concat 交叉编码器(0.8888 +/- 0.0109)相当,同时保持完全可审核。覆盖率为 30% 时,风险从 0.2588 降至 0.1642,相对降低了 37%。作为边界映射实验,我们在 HaluBench 不安全检测上将 SURE-RAG 与 GPT-4o 进行了对比:排名相反(0.3343 vs. 0.7389 unsafe-F1),表明受控充分性验证和自然幻觉检测是不同的问题。