论文
Step-GRPO:内化动态早退以实现高效推理
Step-GRPO: Internalizing Dynamic Early Exit for Efficient Reasoning
摘要
采用长思维链的大型推理模型擅长解决问题,却在冗余校验上浪费算力。抑制这种过度思考很难:训练期长度惩罚可能损害能力,而推理期早退则增加系统开销。为弥合这一差距,我们提出Step-GRPO,一种将动态早退能力直接内化到模型中的新型后训练框架。Step-GRPO利用语言标记来结构化推理,将优化目标从原始token转移到语义步骤。我们引入动态截断rollout机制,让模型在探索时接触简洁的高置信度轨迹,并与基于组级基线动态惩罚冗余的步骤感知相对奖励协同。在三个模型规模、多个基准上的大量实验表明,Step-GRPO实现了更优的准确率-效率权衡。在Qwen3-8B上,与原始模型相比,我们的方法将token消耗降低32.0%,同时避免了传统长度惩罚方法中观察到的准确率下降。
