论文

后训练加强税收

Sharpening Tax in Post-Training

模型评测模型训练强化学习模型行为与机制分析Agentic RL

摘要

关于大语言模型 (LLM) 的强化学习 (RL) 后训练的一个新兴假设是,它只是强化基础模型的现有行为,以牺牲解决方案覆盖率为代价来提高单次精度。尽管在数学和编码任务中观察到了这种权衡,但它不需要扩展到 Agentic 任务,其中多回合工具的使用和交互可能需要在后训练新获得的能力。我们令人惊讶的发现是,经过预先训练的大语言模型,配备了轻型推理工具,可以充当有能力的Agent。尽管准确率低得多 (pass@1),但在有足够的测试时间预算的情况下,它们在解决方案覆盖率 (pass@K) 方面通常超过后训练的同行。我们进一步分析了底层机制,并表明后训练将任务推向两个极端:总是解决或从未解决,从而以解决方案覆盖率为代价提高采样效率和一致性。为了衡量这一成本,我们提出了锐化税,这是一种诊断指标,用于量化后训练测试时可扩展性的损失。在来自四个系列的 14 个基础/后训练模型对和三个 Agentic 基准(总共 42 个案例)中,税收在大多数设置中都很普遍,可以通过几次部署来估计,并且与其他指标有很好的相关性。最后,我们提出了后调组采样(PTGS),这是一种简单的即插即用贝叶斯采样器,可以根据估计的难度调整每个提示的采样温度。在两个 Agentic 环境中进行 RL 训练时,PTGS 比固定温度基线支付的费用更小,可以在重复采样下解决更多任务,同时提高单次精度。