evalci:用于对语言模型评估进行统计上严格比较的 Python 库
evalci: A Python Library for Statistically Rigorous Comparison of Language Model Evaluations
摘要
语言模型评估的主要做法是报告每个模型的单个准确率数字,并声明较高的准确率更好,而不测试差距是否可能是采样噪声。在数千个项目的基准测试中,以及在温度采样下,模型运行与运行之间的差异可能超过模型之间报告的差距,这种做法通常会夸大标题声明的可信度。解决这个问题的统计机制——置信区间、配对显着性检验、功效分析、聚类标准误差、多重比较校正——已经很成熟,但没有标准的、可安装 pip 的工具将其包装成评估实际采用的形式:每个项目的结果表。我们提出了 evalci,一个纯 Python 库(仅限 numpy/scipy/pandas),它将每个项目的结果表转换为可发布的声明 - 例如,“模型 A 击败模型 B,$Δ=3.1$ 点,95% CI [1.2, 5.0],配对排列 $p=0.002$,$n=1{,}319$” - 在一个函数调用中,使用适配器用于 lm-evaluation-harness 和 HELM 输出。每个例程都根据独立参考(统计模型或强力精确枚举)进行验证,而不是仅针对其自身进行验证。作为案例研究,我们重新分析了九种语言模型 MMLU 准确性的公开比较,发现在校正排名所暗示的 36 个成对比较后,8 个相邻排行榜排名差距中的 3 个在统计上并不显着。 evalci 可在 https://pypi.org/project/evalci/ 获取(来源:https://github.com/Shreyaskc/evalci,DOI:https://doi.org/10.5281/zenodo.21201815)