论文

OS-Pruner:经最优停止剪枝推理模型的思维链

OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping

模型推理解码与生成控制

摘要

大语言模型(LLM)经思维链(CoT)提示在复杂推理任务上取得显著成功。但这些模型常表现出“计算性过度思考”:生成冗余推理步骤,增加延迟与成本却不提升准确率。近期研究表明CoT轨迹可被显著剪枝,但既有方法常依赖强加静态思考预算、启发式过滤、经分类的次优提前退出、或昂贵的重训练。本文提出OS-Pruner:一个轻量插件框架,把思维链剪枝形式化为最优停止问题。给定推理前缀,OS-Pruner通过优化显式效用——在最终答案准确率与生成长度间权衡——学习继续推理是否值得其token成本。我们的新表述使模型能动态评估推理链的充分终止点。OS-Pruner在训练与推理时都保持轻量,并为用户提供对推理努力与准确率权衡的细粒度控制。在多样推理基准与基座模型上:OS-Pruner以极小的准确率牺牲取得20–60%的生成长度削减。

OS-Pruner:经最优停止剪枝推理模型的思维链:论文配图
图 1:DeepSeek-R1-Distill-Qwen-7B 的训练动态。评估是在我们的训练数据的保​​留验证子集上进行的,其中包含 500500 个样本。基线长度为 5182 个令牌。