论文

固定模型与温度,LLM评审仍存在重复判决波动

Pinned and Still Unstable: Within-Judge Verdict Variance and the Noise Floor of LLM-as-Judge Leaderboards

模型评测评测方法与指标

摘要

现代LLM评估假设将评审固定在固定模型快照上并在零温度下进行解码会产生可重现的判决。我们证明这种假设是失败的,因为它是LLM作为评审如何在云服务基础设施上运作的属性,而不是任何特定模型系列的属性。四个前沿评审均通过一个主要企业云平台和三个标准基准(Arena-Hard、AlpacaEval 2、MT-Bench)进行服务,相同的固定零温度评审的相同输入在重新运行中会产生不同的判决:每个项目的翻转率平均约为 5%,而决定排行榜利润的千钧一发的项目的翻转率约为 40%,每个评审的幅度跨越 40 倍范围(从0.13%至近10%)。我们引入了针对这种不稳定性量身定制的指标:每项翻转率、两部分稳定性概况(波动分数和条件强度)以及邻接可分离性 - 并报告方差对排名的影响和影响。对于单个评审来说,总排名是稳定的(0% 前 K 不稳定,0% 合并获胜者翻转);降低的是精确度:在配对分层引导下,大约五分之一到四分之三的相邻排行榜位置在统计上是无法区分的,我们主要将噪声基底归因于有限的即时采样而不是判断。在各个评审中,排行榜在粗略排序上达成一致,但在中间存在分歧(Arena-Hard 上家庭之间的 Kendall tau 低至 0.42-0.64),在我们重新评判的 13 个已发布的面对面排名声明中,有 5 个在合理的评审交换或重新运行下失败了。我们认为排行榜报告的未对冲点估计歪曲了仪器的本底噪声,并且我们提出了一个最小的、低成本的报告协议:几个评审重新运行,发布稳定性概况和邻接间隔,以及来自不同家族的至少两名评审的结果。