论文
持有人政策优化
Holder Policy Optimisation
摘要
组相对策略优化 (GRPO) 通过估计一组采样轨迹的优势来增强 大语言模型。然而,将这些轨迹级优势映射到策略更新需要聚合每个序列内的 词元级 概率。这一步依赖固定的聚合机制从根本上限制了算法的适应性。根据经验,我们观察到一个关键的权衡:某些固定聚合经常遭受训练崩溃,而其他聚合则无法产生令人满意的性能。为了解决这个问题,我们提出了 \textbf{HölderPO},这是一种通过 Hölder 均值统一 词元级 概率聚合的广义策略优化框架。通过显式调节参数 $p$,我们的框架提供了对梯度浓度和方差边界之间的权衡的持续控制。理论上,我们证明较大的$p$会集中梯度以放大稀疏学习信号,而较小的$p$会严格限制梯度方差。由于没有静态配置可以普遍解决这种浓度与稳定性的权衡,因此我们使用动态退火算法实例化该框架,该算法在整个训练生命周期中逐步安排 $p$。广泛的评估表明,其稳定性和收敛性优于现有基线。具体来说,我们的方法在多个数学基准上实现了最先进的平均准确度 $54.9\%$,与标准 GRPO 相比产生了 $7.2\%$ 的相对收益,并确保了 ALFWorld 上卓越的 $93.8\%$ 成功率。