论文

批量上下文强化:高效推理的任务扩展法则

Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning

模型训练强化学习

摘要

大语言模型 采用思想链推理实现了强大的性能,但由于过度的词元消耗而增加了推理成本。现有的效率方法(例如显式长度惩罚、难度估计器或多阶段课程)要么会降低推理质量,要么需要复杂的训练流程。我们引入了批量上下文强化,这是一种极简的单阶段训练范例,它通过简单的结构修改来解锁高效推理:训练模型在共享上下文窗口中同时解决 N 个问题,纯粹通过每个实例的准确性来奖励。这个公式创建了一个隐式的 词元预算,它产生了几个关键发现:(1)我们确定了一种新颖的任务扩展法则:随着推理过程中并发问题数量 N 的增加,每个问题的词元使用量单调减少,而准确性的下降比基线更加优雅,将 N 建立为可控的吞吐量维度。 (2) BCR 通过在标准单问题推理中展示“免费午餐”现象来挑战传统的准确性-效率权衡。在 1.5B 和 4B 模型系列中,BCR 将词元使用量减少了 15.8% 至 62.6%,同时在五个主要数学基准中持续保持或提高准确性。 (3) 定性分析揭示了新兴的自我调节效率,其中模型在没有明确的长度监督的情况下自主消除冗余的元认知循环。 (4) 至关重要的是,我们凭经验证明,隐式预算约束成功地规避了显式长度惩罚所固有的对抗性梯度和灾难性优化崩溃,为长度控制提供了一种高度稳定、基于约束的替代方案。这些结果证明 BCR 实用,表明简单的结构激励可以释放 LLM 中潜在的高密度推理。