论文
从不确定的判断到校准的排名:LLM 评估的共形 Elo 估计
From Uncertain Judgments to Calibrated Rankings: Conformal Elo Estimation for LLM Evaluation
摘要
评估新的 大语言模型 通常需要昂贵的大规模人工注释活动。 LLM-as-a-judge 提供了一种更便宜的选择,但法官的分数带有系统性错误 - 例如立场偏见、自我偏好或不及物性 - 可能会严重错误校准最终的排名。我们在两个互补的层面上量化了由此产生的法官与人类的分歧。在本地层面,我们通过将校准的获胜概率而不是硬标签传播到 Bradley-Terry 程序中,根据法官自己的分数差异来估计每场战斗的不确定性。仅这一点就大大提高了 Elo 估计的准确性,当对 LMArena 上 55 个保留模型进行平均时,LLM 派生的评级与人类派生的评级相比,在 17.9 Elo MAE 以内。在全球层面,我们将分割共形预测应用于跨保留模型的 LLM 派生的 Elo 评级和人类派生的 Elo 评级之间的剩余差距,产生具有无分布边际覆盖保证的预测区间,从而解释了不可约的 LLM 与人类分歧。这两层共同产生了一个低成本评估工具,为开发人员提供校准的 Elo 估计和诚实的不确定性界限,而无需访问大规模的人工注释。为了促进可重复性,我们在 https://github.com/kargibora/SoftElo 发布了我们的代码。