论文
成长的烦恼:通过固定参数校准进行可扩展且高效的 LLM 基准测试
Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration
摘要
语言模型和基准的快速发布使得评估每个数据集上的每个模型的成本越来越高。在实践中,模型经常在不同的样本上进行评估,因此很难在研究之间比较分数。为了解决这个问题,我们提出了一个基于多维项目响应理论(IRT)的框架,该框架使用锚项目来校准评估套件的新基准,同时保持先前校准的项目参数固定。我们的方法支持现实的评估设置,其中随着时间的推移引入数据集,并且仅在评估时可用的数据集上评估模型,同时使用每个数据集的固定锚集,以便可以直接比较不同评估周期的结果。在超过 400 个模型的大规模实验中,我们的框架仅使用每个数据集 100 个锚点问题来预测 2-3 个百分点内的全面评估性能,并使用 Spearman $ρ\geq 0.9$ 进行排名保留。这表明基准套件可以随着时间的推移而增长,同时保持分数可比性,因为添加新数据集需要仅在该数据集的锚点上运行现有模型。代码和数据可在以下网址获取:https://eliyahabba.github.io/forming-pains/