论文

主动 RAG 应何时检索?对效用、校准和成本进行预算意识评估

When Should Active RAG Retrieve? A Budget-Aware Evaluation of Utility, Calibration, and Cost

模型评测评测方法与指标

摘要

主动 RAG 系统决定何时在生成过程中检索外部知识,使其成为代理 RAG 和自适应检索的预算敏感案例。然而,评估常常未指定操作点:两个系统可能都要求 50% 的证据使用预算,同时实现不同的保留使用率,因此更高的准确性可以反映更宽松的预算,而不是更好的检索策略。我们通过将主动检索重新转换为效用估计来研究主动 RAG 的预算感知评估,其中检索仅通过其相对于无检索答案的边际正确性变化而有价值。该视图区分了单点评估合并的三个问题:触发分数是否对有用的检索决策进行排名、根据过去数据校准的阈值是否满足未来预算以及触发端计算如何改变部署成本。我们通过精确的 top-k 效用边界、可部署的阈值边界、保守的预算边界、危害审计和成本分解来操作这些问题。在知识密集型多跳 QA 数据集和开放指令模型中,检索危害是不可忽视的,路由器排名随数据集和预算的变化而变化,名义阈值可能会错过目标使用情况,简单的不确定性或检索分数基线通常可以与学习的实用路由器相媲美。因此,具有预算意识的主动 RAG 评估应报告边界、已实现的使用情况、阈值转移误差、危害率和成本分解以及准确性。