论文
Entrocraft:精确控制熵曲线以缓解 LLM 强化学习性能饱和
Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control
摘要
强化学习 (RL) 使 大语言模型 (LLM) 具有复杂的推理能力。然而,大多数 RL 算法都存在性能饱和问题,阻碍了 RL 训练规模的持续增长。这个问题的特点是熵崩溃,这是强化学习探索的一个关键诊断。现有的尝试集中于通过正则化或裁剪来防止熵崩溃。然而,从长远来看,它们产生的熵曲线通常表现出不稳定,这阻碍了性能的提高。在本文中,我们介绍了 Entrocraft,一种简单的拒绝采样方法,通过偏置优势分布来实现用户定制的熵计划。 Entrocraft 不需要客观正则化,并且与优势估计量无关。理论上,我们在最小假设下将每步熵变化与优势分布联系起来。这解释了现有强化学习和熵保持方法的行为。 Entrocraft 还能够对熵表进行系统研究,这表明线性退火(从高值开始并衰减到略低的目标)表现最佳。根据经验,Entrocraft 解决了性能饱和问题,显着提高了泛化能力、输出多样性和长期训练。它使 4B 模型能够超越 8B 基线,在达到稳定状态之前将改进维持时间长达 4 倍,并将 pass@K 比基线提高 50%。