论文
驯服极端词元:具有高斯核优势重新加权的协方差感知 GRPO
Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting
摘要
组相对策略优化(GRPO)已成为提高 大语言模型 推理能力的一种有前途的方法。然而,它很难在训练过程中有效地平衡探索和利用之间的权衡,通常会导致性能不佳。受熵变化受词元概率及其相应优势之间的协方差控制这一理论启发,我们提出了一种无超参数、协方差加权优化方法,该方法通过高斯核动态降低极端 词元级 更新的权重。这种方法自动减少了探索-利用权衡造成的不稳定性,同时保留了信息丰富的学习信号。广泛的实证评估表明,与 GRPO 相比,我们的方法提高了推理基准的下游性能,并随着训练的进展有效地稳定了熵。