论文
EvoThink:经自剪枝与顿悟时刻偏好优化演化大型推理模型思维
EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization
摘要
大型推理模型(LRM)常因冗余验证步骤而过度思考。缓解过度思考的既有方法——快慢思维切换与推理轨迹压缩——未能对LRM推理过程中有益与冗余步骤做细粒度区分,可能在追求效率时损害推理能力。为同时提升推理效率与能力,我们提出EvoThink:一个减少冗余验证、鼓励探索新推理路径的框架。EvoThink含两个关键组件:自剪枝训练(SPT)——一种无监督方法,迭代剪枝冗余推理步骤并在精简轨迹上自训练;顿悟时刻偏好优化(AMPO)——受遗传算法启发,识别有价值的失败推理尝试,合成从错到对的顿悟数据,并优化模型内化该推理模式。在数学推理与代码生成基准上的大量评估表明:EvoThink不仅大幅减少推理时token使用,还提升LRM的推理能力。
