论文
SAS:以步骤级优势选择稳定高效推理训练
Stabilizing Efficient Reasoning with Step-Level Advantage Selection
摘要
大语言模型通过投入大量推理计算取得较强表现,但常生成冗长轨迹。现有高效推理研究使用长度奖励或剪枝降低开销,然而许多方法的后训练上下文窗口远短于基础模型训练,这一因素的独立影响尚未充分分析。论文先发现,不使用长度目标、只在短上下文中用标准 GRPO 后训练,已经能够显著压缩推理,但训练更不稳定,准确率也会下降。步骤级优势选择 SAS 以推理步骤为单位:对正确轨迹中的低置信步骤,以及验证失败轨迹中的高置信步骤赋予零优势;后者的失败常来自截断或验证器问题,而非推理错误。在多种数学与一般推理基准上,相比最强长度感知基线,SAS 平均 Pass@1 提高0.86个百分点,平均推理长度减少16.3%,改善准确性与效率权衡。