论文

项目响应缩放定律:一种有效且可推广的神经缩放估计的测量理论方法

Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation

模型评测评测方法与指标

摘要

缩放定律为理解语言模型 (LM) 的性能提供了一个基本框架,但推导它们需要对数千个检查点或数百万个推理样本进行极其昂贵的评估。为了解决这个问题,我们引入了项目响应尺度法则(IRSL),这是一个将项目响应理论(IRT)集成到尺度法则框架内的统一框架。与单独处理每个模型基准对的传统方法不同,IRSL 将潜在模型能力与问题特征分开,分解 $M$ 模型和 $N$ 问题的标度律估计,以将参数复杂性从 $O(M \times N)$ 显着降低到 $O(M + N)$。我们使用 Beta-IRT 实例化 IRSL,它利用 LM 的经验概率响应(例如 预训练 中的词元概率和测试时间采样中的通过率)来捕获比二进制响应更丰富的信号。我们在两种流行的扩展范例中验证了我们的方法:(1)预训练 下游扩展,使用来自 10 个基准的 6,612 个 LM 检查点和 37,682 个问题; (2) 测试时间扩展,使用来自 4 个基准的 12 个 LM 和 120 个问题,每个问题最多 2,500 个样本。考虑到对现有模型响应的一次性校准,IRSL 在每个基准仅使用 50 个问题(减少 99.9%)即可产生更可靠的标度估计,从而实现与传统方法相当或更高的决策准确性。此外,我们表明估计的潜在模型能力是可概括的,从而能够在共享相同测量目标的基准之间进行准确的性能预测。