论文
测试时间缩放使过度训练的计算变得最佳
Test-Time Scaling Makes Overtraining Compute-Optimal
摘要
测试时的现代 LLM 量表,例如通过重复采样,推理成本随着模型大小和样本数量的增加而增加。这就产生了一种权衡,而预训练缩放法则(例如 Chinchilla)无法解决。我们提出了训练到测试 ($T^2$) 缩放法则,可在固定的端到端预算下联合优化模型大小、训练标记和推理样本数量。 $T^2$ 通过用于测试时缩放的 pass@$k$ 建模来现代化预训练缩放法则,然后联合优化预训练和测试时决策。 $T^2$ 的预测对于不同的建模方法来说是稳健的:测量联合缩放对任务损失的影响以及建模对任务准确性的影响。在八个下游任务中,我们发现,在考虑推理成本时,最佳预训练决策从根本上转变为过度训练状态,远远超出了标准预训练扩展套件的范围。我们通过在 $T^2$ 缩放预测的最佳区域中预训练严重过度训练的模型来验证我们的结果,确认与单独预训练缩放相比,它们的性能要强得多。最后,由于前沿 LLM 是经过后训练的,我们表明我们的发现在 后训练 阶段仍然存在,使得 $T^2$ 扩展在现代部署中有意义。