论文
度量匹配:评估LLM裁判可靠性的子集选择方法
Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability
摘要
LLM 法官用于减少评估开放式文本生成时对昂贵人力的需求。然而,这些评委的可靠性很大程度上取决于他们与人类评分者的一致性——这一特性本身就依赖于昂贵的人类注释。在这项工作中,我们开发了一种方法(指标匹配),用于根据有限的注释估计大语言模型法官基于相关性的可靠性指标。度量匹配选择样本子集进行人工注释,使得该子集与所获取的合成标签的群体可靠性度量相匹配。我们的经验表明,Metric Match 在 4 个不同的相关性指标和 15 个数据集上相对于随机子集选择的获胜率为 0.838,平均估计误差降低了 18.7%,注释需求减少了 32.5%。我们提供了一个成本模型并重点介绍了一项医学案例研究,其中与随机选择专家注释相比,我们的方法节省了 1,041.67 美元。此外,我们将任务从可靠性估计转移到对给定法官是否高于部署阈值的可靠性分类,优于使用指标匹配的随机选择。所有项目代码都是公开可用的,并且我们还提供了一个可安装的包以方便使用。
