论文

跨基准的一般能力的成本效益评估

Cost-Efficient Estimation of General Abilities Across Benchmarks

模型评测评测方法与指标

摘要

已经开发了数千个不同的基准来衡量 大语言模型 (LLM) 的质量。然而之前的工作已经证明,LLM 的性能通常可以通过一小组潜在因素或能力来充分解释。这表明有可能进行更高效、更有原则的基准测试,但比较不同方法的质量仍然很困难。在预测有效性的推动下,我们认为基准测试框架的质量应该基于它如何有效地预测模型在未见过的任务上的性能。为了分析这一目标,我们收集了“大规模项目级数据集”(WILD),这是一个项目模型响应对的数据集,包括对来自 27 个数据集的 163 个任务的 109,564 个独特项目的 65 个模型的评估。该数据集首次分析了不同的技术如何在不同预算约束下预测模型在大量不同的未见过任务上的性能。我们证明,将改进的多维项目响应理论 (IRT) 模型与最佳实验设计驱动的自适应项目选择相结合,可以预测 112 个保留基准任务的性能,平均绝对误差 (MAE) 小于 7%,并且可以在仅观察 16 个项目后实现这一点。我们进一步证明,将成本意识折扣因素纳入我们的选择标准可以将达到 7% MAE 所需的总词元从 141,000 个词元减少到仅 22,000 个,评估成本降低 85%。