论文

词元级 策略优化:通过序列级似然将组级奖励链接到 词元级 聚合

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood

模型训练强化学习

摘要

组相对策略优化(GRPO)显着提高了大语言模型(LLM)的推理能力,特别是数学推理性能。然而,GRPO 和相关的熵正则化方法仍然难以解决 词元级 稀疏奖励问题,这是思想链 (CoT) 推理中固有的挑战。这些方法通常依赖于无差别的 词元级 熵正则化,这很容易导致稀疏词元奖励下的熵崩溃或模型退化。在这项工作中,我们提出了 TEPO,一种新颖的 词元级 框架,该框架(1)利用序列级似然通过 词元级 聚合将组级奖励与单个词元联系起来,(2)引入 词元级 KL 散度掩码约束,该约束针对具有正优势的词元并减少熵以减轻突然的策略更新。实验表明,TEPO不仅在数学推理基准上实现了最先进的性能,而且显着增强了训练稳定性,与GRPO/DAPO相比,收敛时间减少了50%。