论文

为什么全球 LLM 排行榜具有误导性:异构监督机器学习的小组合

Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML

模型评测评测方法与指标

摘要

通过成对的人类反馈对 LLM 进行排名是当前开放式任务排行榜的基础,例如创意写作和解决问题。我们分析了来自 Arena 的 52 个 LLM 的 116 种语言的约 89K 比较,结果表明最适合的全球 Bradley-Terry (BT) 排名具有误导性。近 2/3 的决定性投票被取消,甚至全球 BT 排名的前 50 名模型在统计上也没有区别(前 50 名模型中两两获胜的概率最多为 0.53)。我们将这种失败归因于跨语言、任务和时间的强烈的、结构化的观点异质性。此外,我们发现一个重要特征——*语言*起着关键作用。按语言(和家族)分组大大提高了投票的一致性,导致 ELO 分数的分布提高了两个数量级(即非常一致的排名)。看似全球性的噪音实际上是一致但相互冲突的亚群体的混合物。为了解决监督机器学习中的这种异质性,我们引入了 $(λ, ν)$ 组合框架,这是一小组模型,可实现最多 $λ$ 的预测误差,“覆盖”至少 $ν$ 部分的用户。我们将其表述为集合覆盖问题的变体,并使用底层集合系统的 VC 维度提供保证。在 Arena 数据上,我们的算法仅恢复了 5 个不同的 BT 排名,这些排名以适度的 $λ$ 覆盖了超过 96% 的选票,而全球排名的覆盖率为 21%。我们还提供了 6 个 LLM 的投资组合,其投票数是全球排名前 6 个 LLM 的两倍。我们使用公平正则化分类模型集合进一步构建了 COMPAS 数据集上的分类问题的投资组合,并表明这些投资组合可用于检测数据中的盲点,这可能与政策制定者的独立利益有关。