论文

固定预算、聚类感知的LLM-as-a-Judge评估标准:一项多跳RAG压力测试

A Fixed-Budget, Cluster-Aware Standard for LLM-as-a-Judge Evaluation: A Multi-Hop RAG Stress Test

模型评测评测方法与指标

摘要

检索增强生成(RAG)系统常常通过让大语言模型(LLM)裁判判断哪个答案更好来进行比较。对多跳 RAG 而言,这已既是一个测量问题,也是一个建模问题:同一个分数可能反映检索质量、答案长度、词汇重叠,或一个忽略聚类数据的统计检验。我们要问:当这些选择被显式化时会发生什么。我们为 RAG 中的 LLM-as-a-judge 比较提出一个最低测量标准。该标准固定 top-100 候选池、证据预算、答案上限、生成器和提示;还要求预注册假设、聚类感知推断、在可行时进行精确的聚类符号翻转检验,以及第二裁判复现。聚类化基准可能夸大进展;本领域应当采纳这一标准。我们用 GADMEC(Genetic Algorithm Decoder for Multi-hop Evidence Composition,一个进化式证据选择器)在计算机科学/机器学习(CS/ML)与材料科学的 400 个多跳问题上对该标准进行压力测试。该协议改变了实证结论。二项检验让全部四个语义基线比较看起来显著;聚类感知推断只留下一个经 Bonferroni 校正显著的结果。在相同预算下,BM25 胜过纯语义的 GADMEC,而词汇-语义混合方法在 CS/ML 上挽回局面,并缩小了材料科学上的差距。

固定预算、聚类感知的LLM-as-a-Judge评估标准:一项多跳RAG压力测试:论文配图
图 5:每个组合的纯语义 GADMEC 获胜率,按领域和语料库制度分层(TOP/NICHO)。每个面板都是一个域;每行是一个跨子字段组合;这两列报告了对 Greedy 和 MMR 的胜率。热图是一种描述性稳定性检查:它揭示了总速率背后的异质性,而无需添加单独的假设检验。