论文
预测代理检索增强生成中的部分答案质量和效用
Predicting Partial Answer Quality and Utility in Agentic Retrieval-Augmented Generation
摘要
代理检索增强生成(RAG)已成为多跳问答的有前景的范例,其中推理模型迭代地向检索器发出查询,并将新检索到的上下文合并到后续推理步骤中。虽然这个迭代过程可以提高最终答案的质量,但目前对代理 RAG 的评估主要集中在端到端结果上,并且对模型答案状态在生成过程中如何变化的可见性有限。在这项工作中,我们引入了一个轨迹内探测框架来研究代理 RAG 中的中间答案状态。具体来说,在每次检索推理迭代之后,我们强制代理模型停止推理并根据其当前状态生成中间答案。这使我们能够定义两个迭代级别的度量:每次迭代的部分答案质量,以及迭代中部分答案质量变化的部分效用。我们对多跳 QA 基准的分析表明,部分答案质量通常在自然终止之前趋于稳定,许多后续迭代仅贡献了很小的可测量的改进。因此,我们制定了两个预测任务,部分答案质量预测和部分效用预测,并从迭代内、迭代间和查询迭代的角度研究轨迹导出信号。实验表明,部分答案质量比部分效用更容易预测,监督模型的质量预测 Pearson r 值高于 0.43。最后,使用预测的答案质量和效用进行提前停止可将平均迭代次数减少约 11%,同时保留通过自然停止实现的最终答案质量的约 98%。