论文

Agentic RAG 评估:跨问题、轨迹和读取的预算分配

Agentic RAG Evaluation: Budget Allocation Across Questions, Trajectories, and Reads

模型评测评测方法与指标

摘要

Agentic检索增强生成跨度问题、搜索轨迹和重复答案中的评估预算。我们使用 HotpotQA 和 MuSiQue 上的检索反馈比较来测量分配精度、读取效率和成本边界。在 34.14--34.39M 模型token中,更广泛的问题覆盖率与 5 次读取相比,标准误差降低了 33%,与 3 条轨迹相比,标准误差降低了 12.6%。存档的嵌套预测和仅 Q 预测预测这些分配分别在 4.0\% 和 3.5\% 范围内。除了双轨迹审计之外,深度子集没有建立明显的预测优势。在相同的token预算下,相对于拟合最优值的一次读取方差惩罚为 0--9.9%,具有很大的 Pro 不确定性。根据记录的模型费用,在每 1,000 个请求 0--1 美元的搜索价格下,更多的问题会击败更多的轨迹;问题与阅读费用排名仍未解决。温度零削减回答了从 14.3\% 到 3.4\% 的分歧,而比较精度保持相似。 \par\medskip\noindent关键字: Agentic RAG;评估预算;普遍性理论;重复采样。