论文
思考还是不思考:把推理分配到真正有益之处
To Think or Not to Think: Allocating Reasoning Where It Helps
摘要
强化学习(RL)已被证明能有效提升大型语言模型(LLM)的推理性能,尤其是在复杂的数学和编程任务上。然而这种能力伴随着系统性的长度错配:模型在简单问题上投入过多推理,而在更难的问题上过早终止,在几乎没有准确率提升的情况下降低了推理效率。许多长度自适应方法通过按问题难度分配token预算来缓解这一问题,隐含假设更难的问题总能从更长推理中单调受益。与此相反,我们发现推理长度对准确率的影响集中在部分可解的问题上。我们的进一步分析揭示,显式长度奖励可能产生意外的训练动态。受这些发现启发,我们提出CARE(对比准确率奖励估计),它从在线采样的响应中比较每个问题有益的长度调整,并在Group Relative Policy Optimization内施加自适应长度奖励,无需额外超参数或额外推理成本。在多个推理基准上的实验表明,我们的方法将Pass@1提升最多4%,同时把推理长度缩短37%,实现更高的token效率。代码将在论文录用后发布。
