论文

思考还是不思考:把推理分配到真正有益之处

To Think or Not to Think: Allocating Reasoning Where It Helps

模型训练强化学习

摘要

强化学习(RL)已被证明能有效提升大型语言模型(LLM)的推理性能,尤其是在复杂的数学和编程任务上。然而这种能力伴随着系统性的长度错配:模型在简单问题上投入过多推理,而在更难的问题上过早终止,在几乎没有准确率提升的情况下降低了推理效率。许多长度自适应方法通过按问题难度分配token预算来缓解这一问题,隐含假设更难的问题总能从更长推理中单调受益。与此相反,我们发现推理长度对准确率的影响集中在部分可解的问题上。我们的进一步分析揭示,显式长度奖励可能产生意外的训练动态。受这些发现启发,我们提出CARE(对比准确率奖励估计),它从在线采样的响应中比较每个问题有益的长度调整,并在Group Relative Policy Optimization内施加自适应长度奖励,无需额外超参数或额外推理成本。在多个推理基准上的实验表明,我们的方法将Pass@1提升最多4%,同时把推理长度缩短37%,实现更高的token效率。代码将在论文录用后发布。

思考还是不思考:把推理分配到真正有益之处:论文配图
图 2:短奖励 Qwen3-1.7B 在四个难度子集上长度变化 Δ 与准确率变化 Δ 的密度热图。(0.25, 0.5] 与 (0.5, 0.75] 子集中有相当比例的问题准确率有所提升,这与“更难的问题会从额外 token 中获益”的假设相矛盾。