论文

Eval-Pair Matrix:对同一答案配对评估RAG的LLM裁判

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

模型评测评测方法与指标

摘要

RAG常用LLM作为裁判,但同一模型家族同时生成和评分,使自我宽容难以识别。论文提出面向有来源依据的RAG的受控元评估协议Eval-Pair Matrix:在GaRAGe的问题和证据段落中,每条引入一个会影响答案的隐藏矛盾;使用GPT、Grok和Gemini根据扰动段落生成回答,再由这三个模型盲评回答是否与原始段落一致。实验包含300条核心记录、897个带标签输出和3×3交叉矩阵中的2,683次裁判判断,主分析采用275条完全验证的记录。 论文不直接跨不同答案比较对角与非对角单元,而是在完全相同的候选答案上配对裁判。这改变了结果解释:对角与非对角F1相近,同模型召回率的配对效应接近零,为-0.5个百分点,95%聚类bootstrap置信区间为[-2.7,+1.7]。唯一稳健的配对差异出现在未采用所诱导断言的回答中,同模型裁判的报错比例低4.3个百分点。针对性人工复查发现,表面误报实际上是发现其他来源错误、诱导断言是否被采用的标签错误,或无法明确判定的情况,没有一例被确认是真正误报。作者建议RAG裁判研究报告完整矩阵、同答案配对效应、行为分层及标签与任务的一致性。