论文

EvoThink:经自剪枝与顿悟时刻偏好优化演化大型推理模型思维

EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization

模型训练偏好优化

摘要

大型推理模型(LRM)常因冗余验证步骤而过度思考。缓解过度思考的既有方法——快慢思维切换与推理轨迹压缩——未能对LRM推理过程中有益与冗余步骤做细粒度区分,可能在追求效率时损害推理能力。为同时提升推理效率与能力,我们提出EvoThink:一个减少冗余验证、鼓励探索新推理路径的框架。EvoThink含两个关键组件:自剪枝训练(SPT)——一种无监督方法,迭代剪枝冗余推理步骤并在精简轨迹上自训练;顿悟时刻偏好优化(AMPO)——受遗传算法启发,识别有价值的失败推理尝试,合成从错到对的顿悟数据,并优化模型内化该推理模式。在数学推理与代码生成基准上的大量评估表明:EvoThink不仅大幅减少推理时token使用,还提升LRM的推理能力。

EvoThink:经自剪枝与顿悟时刻偏好优化演化大型推理模型思维:论文配图
图 1:DeepSeek-R1 中过度思考的示例。该模型的推理轨迹可以分解为一系列独立的原子推理单元:独立的文本片段,每个片段捕获单个推理步骤并得出局部结论。虽然有益的单元(绿色)有效地加深了推理,但低效的单元(紫色)由冗余的自我验证组成,消耗了词元而不增加新的见解。