论文
Re:CAP - 审核生产 RAG 管道中的检索覆盖率
Re:CAP - Auditing Retrieval Coverage in Production RAG Pipelines
摘要
检索增强生成 (RAG) 在生产中很难监控:对于实时重新索引的非平稳数百万段语料库,不存在详尽的相关性标签。因此,检索质量通常没有得到充分研究,并且常常被忽视以支持面向世代的指标。在这项工作中,我们建议通过探究丢失文档的证据而不是枚举每个相关文档来审核检索覆盖率。我们的方法 Re:CAP(迭代探测的 REtrieval Coverage Audit)是一种无参考审计循环,应用于已部署的 RAG 管道的初始答案和检索到的上下文:它识别已涵盖的主题,为看似缺失的主题生成探测问题,检索候选文档,并应用 LLM 作为法官来仅保留那些引入先前未检索信息的文档。在四个公共基准上,Re:CAP 恢复了 BM25 top-500 无法达到的黄金标签的 9-29%,在 TREC-COVID 上上升到 48%。在 MuSiQue Re:CAP 上,召回率比混合排名前 500 名高出 +12.9 个百分点,而文档预算不到一半。集合 BM25、密集和混合基线(每个前 500 个)仍然遗漏了 Re:CAP 恢复的 TREC-COVID 上 21.2% 的黄金文档;人类注释者判断,这些结构不同的文档中有 78.9% 向基线答案添加了新信息(Fleiss $\kappa$ = 0.79,n = 123),并且 73.9% 的实时生产流量(n = 180)。在三次独立运行中,端到端召回的重现性在 $\pm$1% 以内,这使得 Re:CAP 成为定期检索审核的稳定工具。