论文
STARE:意外引导的 词元级 优势重新加权以实现策略熵稳定性
STARE: Surprisal-Guided Token-Level Advantage Reweighting for Policy Entropy Stability
摘要
具有可验证奖励的强化学习算法(例如 GRPO)已成为 LLM 中复杂推理的主要 后训练 范式,但在训练过程中通常会遭受策略熵崩溃。我们对 GRPO 下的 词元级 熵动力学进行一阶梯度分析,并识别 词元级 贡献分配不匹配:每个词元的熵变化分解为轨迹级优势和下一个词元分布上的熵敏感性函数的乘积,产生优势-惊喜四象限结构和近临界性属性。受此启发,我们提出了 STARE(Surprisal-guided 词元级 Advantage Reweighting forpolicy Entropy stable),它通过批次内部的惊喜分位数来识别熵关键的词元子集,有选择地重新加权其有效优势,并结合目标熵闭环门来实现稳定的熵调节。在从 1.5B 到 32B 的模型规模和三个任务系列(短 CoT、长 CoT 和多轮工具使用)中,STARE 可以在数千步上维持稳定的 RL 训练,同时将策略熵保持在目标范围内。在 AIME24 和 AIME25 上,STARE 的平均准确度比 DAPO 和其他竞争基线高 4%-8%,反射标记和响应长度同步增长,表明持续的探索-利用平衡,进一步释放 RL 训练潜力。代码可在 https://github.com/hp-luo/STARE 获取。