论文
通过近端熵策略优化推进 RLVR 中的熵级信用分配
Advancing Entropy-Level Credit Assignment in RLVR via Proximal Entropy Policy Optimization
摘要
无价值模型的 RLVR 方法(例如 GRPO)为部署中的所有词元分配统一的优势,忽略了词元贡献的不平等。最近的方法使用词元熵作为重要性代理,但在整个批次中全局计算它,将重要性与即时难度和位置趋势混为一谈。我们认为,重要性应该根据每个标记的本地上下文来衡量。我们引入了近端熵,这是一种相对于相邻标记的标记重要性的局部度量,并证明它对于两个混杂因素都是不变的。近端熵策略优化 (PEPO) 使用它来衡量每个词元的优势,并在 Qwen3-1.7B、Qwen3-4B 和 Llama-3.2-3B-Instruct 的数学推理上优于 GRPO 和基于熵的基线。我们还展示了该公式可以推广到其他算法,其中将近端熵替换到现有方法中可以得到改进,并且将其应用于单流强化学习可以在全局熵失败的情况下取得成功。