论文
OS-Pruner:经最优停止剪枝推理模型的思维链
OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping
摘要
大语言模型(LLM)经思维链(CoT)提示在复杂推理任务上取得显著成功。但这些模型常表现出“计算性过度思考”:生成冗余推理步骤,增加延迟与成本却不提升准确率。近期研究表明CoT轨迹可被显著剪枝,但既有方法常依赖强加静态思考预算、启发式过滤、经分类的次优提前退出、或昂贵的重训练。本文提出OS-Pruner:一个轻量插件框架,把思维链剪枝形式化为最优停止问题。给定推理前缀,OS-Pruner通过优化显式效用——在最终答案准确率与生成长度间权衡——学习继续推理是否值得其token成本。我们的新表述使模型能动态评估推理链的充分终止点。OS-Pruner在训练与推理时都保持轻量,并为用户提供对推理努力与准确率权衡的细粒度控制。在多样推理基准与基座模型上:OS-Pruner以极小的准确率牺牲取得20–60%的生成长度削减。
