论文
仅仅回忆是不够的:针对预算受限的检索增强一代的读者上下文诊断
Recall Is Not Enough: A Reader-Context Diagnostic for Budget-Constrained Retrieval-Augmented Generation
摘要
固定上下文预算的RAG必须选择证据,检索结果只有一部分能进入阅读模型。recall@k评价检索集合,但模型读取的是最终组装的上下文;一旦组装需要丢弃证据,二者便不再等价。本文提出answer-in-context,衡量标准答案是否保留在组装后的上下文中,认为预算受限RAG应优化这一指标。在三个多跳数据集上,相比仅用召回率,该诊断额外增加0.17—0.27的解释方差;即使全部标准证据都已检索到,组装后是否保留答案,仍对应4.6倍的精确匹配率差异。两项独立干预支持其作用:只提高文档覆盖率却不提高答案保留的组装改动,不改变准确率;破坏答案片段的提示压缩会同时降低两者。分级变体支持没有逐字答案片段的自由形式回答。研究将上下文构建表述为预算约束下的子模最大化,得到的组装方法在三个阅读模型系列、四个规模和四种预算中,以相同或更低词元成本优于top-k截断及LLMLingua-2压缩。相比手工调整的查询导向启发式,方法总体达到相当表现,只有证据密度成为约束时明显胜出;作者发现该启发式近似优化相同目标。全文表明,答案证据是否真正进入上下文能够解释哪些优化有效、哪些无效。