论文
ERR+:高效果断的顺序熵解析 LLM 推理
ERR+: Sequential Entropy Resolution for Efficient and Decisive LLM Reasoning
摘要
大型推理模型通过具有可验证奖励的强化学习 (RLVR) 生成扩展的思想链 (CoT) 轨迹,从而在复杂任务上实现出色的性能。虽然当前的 RLVR 方法通过基于正确性的奖励信号取得了很好的成果,但它们对推理过程本身的质量提供的指导有限,导致内部推理结构很大程度上未得到优化。通过对多个模型系列的实证分析,我们发现了一个一致的模式:正确的推理轨迹比错误的推理轨迹在思维阶段表现出更频繁和更大的 词元级 熵下降。我们提出了 ERR+,这是一个基于这一观察结果的两阶段 RLVR 框架。第一阶段使用熵缓解奖励(ERR)进行训练,该奖励与思考阶段累积的 词元级 熵下降成正比,并按响应长度对数归一化。与之前抑制熵的方法不同,ERR 奖励不确定性的解决,同时使探索性的高熵状态不受约束。第二阶段引入了鲁棒相对效率奖励,它通过 $\tanh$ 转换的组内 $z$ 分数,对每个响应的长度与共同生成的同行进行评分。我们提供的正式分析表明,两个目标的联合优化会在早期训练中引起梯度冲突,从而激发顺序设计。对五个数据集的实验表明,跨模型主干的准确性和响应简洁性均得到了持续改进。我们的代码位于 https://github.com/XrkArul/err_response