论文

获取之前了解:检索增强生成的校准检索预算分配

Know Before You Fetch: Calibrated Retrieval-Budget Allocation for Retrieval-Augmented Generation

上下文与知识检索增强

摘要

检索增强生成(RAG)通常为每个查询检索固定数量的段落。当读者已经知道答案时,这是浪费,而当不相关或部分相关的段落分散读者的注意力时,这可能是有害的。我们将自适应 RAG 制定为校准的检索预算分配:给定一个查询,决定是否回答闭卷、检索紧凑上下文 (k=1)、检索完整上下文 (k=5) 或弃权。贡献的是概率接口而不是新的原始不确定性信号。我们将序列对数概率和前缀 logits 不确定性信号校准为正确概率,然后使用这些概率进行分级上下文选择、选择性弃权和显式延迟/词元权衡。在 TriviaQA、Natural Questions 和 MS MARCO 上的核心 QA 实验中,通过辅助 PopQA 动机和 Qwen/Llama 系列检查,诊断性折叠校准显着提高了概率质量:对于序列对数概率,TriviaQA 上的 ECE 从 0.275 下降到 0.062,NQ 上从 0.643 下降到 0.009,MS MARCO 上从 0.711 下降到 0.031。分级检索改善了我们的信号和 TARG 式前缀熵/裕度的全上下文和通道预算边界,而检索调用 AUC 本质上仍然与二元门控相关,因为 k=1 仍然是检索调用。保留的训练/验证/测试阈值实验报告可部署的操作点。在匹配精度的前沿工作点,测得的成本模型显示,门控并非普遍更快:它在 Qwen3-8B 上增加了约 27% 的延迟,但在 Qwen3-32B 上节省了约 8%。这些结果支持了自适应 RAG 的细微差别:校准置信度最好理解为在任务和系统约束下分配检索预算的可重用接口。