论文
SAT:以逐步自适应思考平衡推理精度与效率
SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking
摘要
大推理模型(Large Reasoning Model,LRM)革新了复杂问题求解,但普遍表现出“过度思考”,生成不必要冗长的推理链。虽然现有方案提升了词元效率,但往往牺牲细粒度控制,或可能破坏推理过程的逻辑完整性。为此,我们提出逐步自适应思考(Stepwise Adaptive Thinking,SAT),一个在保留核心推理结构的同时执行步骤级、难度感知剪枝的框架。SAT将推理形式化为具有不同思考模式(慢速、正常、快速、跳过)的有限状态机(Finite-State Machine,FSM)。它利用轻量级过程奖励模型(Process Reward Model,PRM)在这些状态间动态切换,压缩简单步骤同时为困难步骤保留深度。跨9个LRM与7个基准的实验表明,SAT最多可将推理词元减少40%,同时总体保持或提升准确率。
