论文

RAT:用于 RAG 评估的统一贝叶斯模型

The RAT: A Unified Bayesian Model for RAG Evaluation

模型评测评测方法与指标

摘要

评估检索增强生成(RAG)系统不仅需要评估端到端的正确性,还需要评估各个组件如何交互以及错误如何通过管道传播。我们引入了一个贝叶斯评估框架,该框架对检索成功、弃权行为和答案正确性进行联合建模,并根据管道的信息流进行分解。该模型区分任务的成功。用户是否收到了正确的答案(来自生成器的成功)以及生成器在给定检索结果的情况下是否表现得适当。我们将该框架应用于三个数据集、三个 检索器 和三个生成器的 27 个 RAG 配置,并表明条件分解揭示了在边际指标下看起来等效的系统之间存在显着的行为差异。我们进一步分析了注释分配问题,证明检索成功注释比任务成功注释在估计策略依从性方面提供了更多信息,并为这种不对称性提供了信息论解释。最后,我们扩展了模型,将 LLM-as-a-judge 注释合并为校准的噪声观察结果,使从业者能够在统一的概率模型中将有限的人类判断与更便宜的自动评估相结合。