论文

度量匹配:评估LLM裁判可靠性的子集选择方法

Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability

模型评测评测方法与指标

摘要

LLM 法官用于减少评估开放式文本生成时对昂贵人力的需求。然而,这些评委的可靠性很大程度上取决于他们与人类评分者的一致性——这一特性本身就依赖于昂贵的人类注释。在这项工作中,我们开发了一种方法(指标匹配),用于根据有限的注释估计大语言模型法官基于相关性的可靠性指标。度量匹配选择样本子集进行人工注释,使得该子集与所获取的合成标签的群体可靠性度量相匹配。我们的经验表明,Metric Match 在 4 个不同的相关性指标和 15 个数据集上相对于随机子集选择的获胜率为 0.838,平均估计误差降低了 18.7%,注释需求减少了 32.5%。我们提供了一个成本模型并重点介绍了一项医学案例研究,其中与随机选择专家注释相比,我们的方法节省了 1,041.67 美元。此外,我们将任务从可靠性估计转移到对给定法官是否高于部署阈值的可靠性分类,优于使用指标匹配的随机选择。所有项目代码都是公开可用的,并且我们还提供了一个可安装的包以方便使用。

度量匹配:评估LLM裁判可靠性的子集选择方法:论文配图
图 1:LLM 法官评估框架和我们的方法概述。给定文本样本𝒳\mathcal{X},并判断模型MM进行评估,我们得到M′εℳM^{\prime}\in\mathcal{M}的分数{M⁡(x),M′​(x)}x∈𝒳\{M(x),M^{\prime}(x)\}_{x\in\mathcal{X}}。我们选择 bb 文本进行人工注释。配备可靠性度量函数 TT,我们估计目标参数 ρ^\hat{\rho}。我们表明,我们对 ρ^\hat{\rho} 的改进估计会导致下游影响。