论文

LLM 归因指标是否会转移?跨数据集和结构的审计检索增强生成评估

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

模型评测评测方法与指标

摘要

实践中通常将 LLM 检索增强生成中的自动归因指标视为可互换的。我们审核了八个自动评分器——词汇、嵌入和 BERTScore 基线以及蕴涵/证据依赖训练模型(clean 和 FEVER NLI、检查器 MiniCheck)——跨越三种评估结构(出处/话题性、生成答案归因和事实检查蕴涵),询问是否有任何评分器转移:在多数据集构造的每个数据集上保持在最佳审核评分器的 95% 置信区间内。在具有最多多数据集人工标记覆盖率的构造中——生成答案归因(AttributionBench 的四个源数据集,n = 1,610,具有独立的 HAGRID,n = 2,150)——没有一个经过审计的自动评分器会这样做:每个数据集指标排名反转(Kendall tau = -0.64,AttributedQA 与 LFQA 上的 p = 0.031),并且在短期声明 AttributedQA 上表现最好的现成 NLI 评分器 (AUROC 0.90) 在长式 LFQA 上下降到 AUROC 0.53(机会),其中 BERTScore 获胜 (0.91);在测试的截断设置下,反转仍然存在。这种不稳定性有一个具体的决策成本:选择评估者的天真“平均最佳”规则失败了保留一个数据集(平均保留遗憾 0.172 AUROC,比固定一个评分者更糟糕),因此指标选择应该在目标数据集上验证,而不是从其他地方的性能假设。基于提示的 LLM 判断避免了自动评分器遭受的机会级别崩溃(没有 LFQA 崩溃),但并不是一律最佳,成本高出约 100 倍,并且具有不确定性——重新定位而不是消除验证负担。