论文
ERPO:词元级 大型推理模型的熵调节策略优化
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
摘要
来自可验证奖励的强化学习显着提高了 大语言模型 的推理能力。然而,组相对策略优化(GRPO)通常为所有词元分配统一的序列级优势,从而忽略了推理链上的内在信息异质性。我们表明,这种粗粒度的奖励归因会导致过早的熵崩溃,并促使模型生成冗余的、低质量的推理路径。通过系统的实证分析,我们确定了关键决策枢轴(CDP):政策轨迹对扰动最敏感的瞬时高熵状态。这些枢纽代表了“岔路口”,其中有效的多路径探索至关重要,但往往受到统一优势信号的抑制。基于这些见解,我们提出了熵调节策略优化(ERPO),它将优化重点从粗序列转变为细粒度的词元动态。 ERPO 引入了三个协同组件:(i)熵感知门控,它自适应地放大 CDP 的探索,以促进多样化的路径发现; (ii) 基于桶的隐式标准化,通过调整词元进度窗口来减轻难度偏差; (iii) 结果锚定的优势综合,通过结果驱动的锚点重新加权 词元级 信号。对竞争性数学基准的大量实验表明,ERPO 的性能明显优于 GRPO。值得注意的是,ERPO 不仅提高了推理准确性,而且还产生了更加简洁和稳健的推导路径,同时实现了与具有更多数量级参数的大型模型相当的性能。