论文

SAT:以逐步自适应思考平衡推理精度与效率

SAT: Balancing Reasoning Accuracy and Efficiency with Stepwise Adaptive Thinking

模型推理测试时计算扩展

摘要

大推理模型(Large Reasoning Model,LRM)革新了复杂问题求解,但普遍表现出“过度思考”,生成不必要冗长的推理链。虽然现有方案提升了词元效率,但往往牺牲细粒度控制,或可能破坏推理过程的逻辑完整性。为此,我们提出逐步自适应思考(Stepwise Adaptive Thinking,SAT),一个在保留核心推理结构的同时执行步骤级、难度感知剪枝的框架。SAT将推理形式化为具有不同思考模式(慢速、正常、快速、跳过)的有限状态机(Finite-State Machine,FSM)。它利用轻量级过程奖励模型(Process Reward Model,PRM)在这些状态间动态切换,压缩简单步骤同时为困难步骤保留深度。跨9个LRM与7个基准的实验表明,SAT最多可将推理词元减少40%,同时总体保持或提升准确率。

SAT:以逐步自适应思考平衡推理精度与效率:论文配图
图 1:基线与 SAT 的比较。 COT 对简单步骤进行冗余检查,Early-Stopping 在高置信度的首次通过答案后停止并失败,而 SAT 在简单步骤上跳过冗余,但保留对困难步骤的验证,有效地获得正确答案。