论文
后训练 应该优化什么?测试时间缩放定律视角
What should post-training optimize? A test-time scaling law perspective
摘要
大语言模型 越来越多地部署测试时策略:对 $N$ 响应进行采样,使用奖励模型或验证器对其进行评分,然后返回最佳结果。此部署规则暴露了 后训练 中的不匹配:标准目标优化单个响应的平均奖励,而最佳 $N$ 性能由奖励分布的上尾部控制。最近的测试时间感知目标部分解决了这种不匹配问题,但通常假设训练可以使用与部署相同的每个提示部署预算,当 后训练 必须覆盖许多提示而部署可以分配更大的每个提示测试时间计算时,这是不切实际的。我们研究了这种预算不匹配机制,其中在训练期间每次提示只能进行 $m\ll N$ 部署,但目标是最佳的 $N$ 部署。在奖励尾部的结构假设下,我们表明,最好的 $N$ 目标的策略梯度可以通过推断上尾统计数据从更小的采样轨迹组中近似得出。这产生了一系列面向最佳 $N$ 的尾部外推估计器 后训练:一个简单的直接估计器、尾部外推优势 (TEA) 和一个基于矩消除的固定阶去偏 Prefix-TEA 估计器。指令跟踪任务的实验表明,TEA 和 Prefix-TEA 在各种训练和测试时间预算设置下提高了不同语言模型、奖励模型和数据集的 best-of-$N$ 性能。