论文

ETR:用于高效思维链推理的熵趋势奖励

ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning

模型训练强化学习RLVR

摘要

思维链(CoT)推理提升了大语言模型在复杂任务上的表现,但常常产生过长且低效的推理轨迹。现有方法使用长度惩罚或全局熵缩减来缩短CoT,隐含地假设在推理全程低不确定性都是可取的。我们则表明,推理效率由不确定性的轨迹所决定。熵呈主导性下降趋势的CoT要短得多。受此启发,我们提出熵趋势奖励(ETR),一个轨迹感知的目标,在允许有限局部探索的同时鼓励不确定性的逐步降低。我们将ETR集成到组相对策略优化(GRPO)中,并在多个推理模型和具有挑战性的基准上进行评估。ETR持续取得更优的准确率-效率权衡,在四个基准上将DeepSeek-R1-Distill-7B的准确率提升9.9%,同时将CoT长度缩短67%。代码发布于 https://github.com/Xuan1030/ETR

ETR:用于高效思维链推理的熵趋势奖励:论文配图
图 3:RL 训练中的熵趋势奖励 (ETR) 概述。 ETR 从生成的推出中计算逐步熵,聚合熵变化与动量以捕获全局熵下降,并提供奖励信号,结合正确性监督,以指导策略更新走向更收敛的推理。