论文

用于评估 大语言模型 的可解释和可扩展的框架

An Interpretable and Scalable Framework for Evaluating Large Language Models

模型评测评测方法与指标

摘要

大语言模型 (LLM) 的评估越来越重要,但标准基准测试方法依赖于平均精度,忽略了 LLM 输出的固有随机性和基准项目的异质性。项目响应理论(IRT)为潜在模型能力和项目特征建模提供了一个原则框架,但传统方法计算成本昂贵且数值不稳定,限制了大规模实施。为了应对这些挑战,我们提出了一个基于多数化-最小化原则的可解释和可扩展的 LLM 评估框架。我们的方法将问题重新表述为一系列约束矩阵分解子问题,从而实现稳定有效的参数估计,并在可识别性和收敛性方面提供理论保证。对合成数据集和真实数据集(包括 MATH-500 和六个 Open LLM Leaderboard 基准)的实验表明,我们的方法实现了卓越的可扩展性和可解释性。与竞争方法相比,它提供了数量级的加速,同时保持了相当甚至更高的估计精度。我们的结果符合既定的缩放法则,并提供对项目难度和歧视的见解,为更有原则的基准设计提供信息。