论文
ETR:用于高效思维链推理的熵趋势奖励
ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning
摘要
思维链(CoT)推理提升了大语言模型在复杂任务上的表现,但常常产生过长且低效的推理轨迹。现有方法使用长度惩罚或全局熵缩减来缩短CoT,隐含地假设在推理全程低不确定性都是可取的。我们则表明,推理效率由不确定性的轨迹所决定。熵呈主导性下降趋势的CoT要短得多。受此启发,我们提出熵趋势奖励(ETR),一个轨迹感知的目标,在允许有限局部探索的同时鼓励不确定性的逐步降低。我们将ETR集成到组相对策略优化(GRPO)中,并在多个推理模型和具有挑战性的基准上进行评估。ETR持续取得更优的准确率-效率权衡,在四个基准上将DeepSeek-R1-Distill-7B的准确率提升9.9%,同时将CoT长度缩短67%。代码发布于 https://github.com/Xuan1030/ETR
