论文

污染导致分数增加,但很少重新排序 大语言模型 排行榜

Contamination Inflates Scores but Rarely Reorders Large Language Model Leaderboards

模型评测评测方法与指标

摘要

基准污染,即测试项目泄漏到训练数据中,被广泛描述为对 大语言模型 (LLM) 排行榜可靠性的威胁。我们认为,这种担忧混淆了两个不同的问题:污染是否会夸大绝对分数,以及它是否会重新排序模型的排名。我们将污染重新定义为对锚项目不变性的违反,并通过原始项目与语义上等效的释义项目的差异功能来衡量它,这是一种项目内对比,可以保持所测量的技能固定并将记忆与能力隔离开来。使用来自 47 个公开发布的模型和 74 个使用已知污染剂量进行微调的模型的每个实例的响应,跨越四个基准(ARC、GSM8K、HellaSwag、MMLU),我们首先根据 真值 校准测量:它以剂量响应方式恢复注入的污染(测试集泄漏的校正效果为 +0.187 个准确点),并且从不标记仅在合法训练分割上训练的阴性对照模型(-0.012)。然后,我们量化排行榜影响:标准排行榜和释义控制排行榜之间的排名相关性为 0.997,敏感性分析显示,观察到的差异污染远低于移动排名所需的水平,188 个模型基准案例中只有 3 个显示差异污染在两个参考文献中得到证实。因此,这些公共模型之间的污染基本上是一致的:它在不重新排列排行榜的情况下夸大了绝对分数,并且排名扭曲需要罕见的差异污染情况。我们提供校准的不变性审计,作为参考实现发布,并建议排行榜报告释义控制的排名以及置信区间。