论文

一致高估证据:LLM评审共识中的错误依赖

Agreement Overstates Evidence: Error Dependence in LLM Judge Consensus

模型评测评测方法与指标

摘要

LLM评审之间的共识常被视为决策正确的有力证据。这假设评审员的错误相互独立。实践中,LLM评审员往往以相似方式训练与评估,因此可能犯同样的错误。我们研究这种依赖如何影响共识的可靠性。我们在开源权重与前沿LLM评审员中都发现大量错误相关。在我们由十位评审员组成的主库中,评审错误之间的平均两两相关为0.21。结果,十位评审员仅提供大约相当于3.5位独立评审员的统计信息量。在我们评估的高准确率前沿评审员中,这种依赖甚至更强,包括来自不同提供商的评审员。在多达28%的比较中,忽略共享错误会得出某系统显著更优的结论,而考虑共享错误后并非如此。我们还发现错误的模式很重要:多数评审员共享的错误与集中在较小群体的错误对共识的影响不同,并偏好不同的投票方法。因此,仅测量总体相关量是不够的。我们的结果提示一种简单方法:用少量可信样本估计评审员准确率并识别共享错误,随后在分析结果时考虑这些共享错误,并在应用于新数据之前用可信样本选择投票方法。

一致高估证据:LLM评审共识中的错误依赖:论文配图
图 7:在筛选出的配置中,聚合规则的提升空间随平均误差相关性与有效集成规模的变化。标记形状表示任务族。结果表明,可测量的相关性本身并不意味着各聚合规则之间存在有用的差异。