论文

ARMOR:使用 离策略 锚样本稳定 同策略 LLM RL

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

模型训练强化学习

摘要

强化学习(RL)显着增强了 大语言模型(LLM)的推理能力,但训练过程仍然非常脆弱。在这项工作中,我们研究了这种不稳定性的一个关键根源:过度优化,其中模型利用训练启发式方法,而牺牲了可推广的推理。虽然反向 KL 正则化是防止这种退化的标准防御措施,但我们的分析表明,在这种情况下它通常是不够的,因为它无法确保参考分布的全面覆盖。为了解决这个问题,我们提出了 ARMOR(强化学习的锚点轨迹采样和混合优化),这是一个将范式从被动惩罚转变为主动样本稳定的框架。 ARMOR 包含两个关键组件:(1) Anchor Rollout,它利用参考策略中的 离策略 数据来保留已建立的解决方案模式; (2)混合优化,重新制定政策目标,在不依赖辅助损失的情况下实现可控勘探。关于推理基准的大量实验验证了 ARMOR 可以有效缓解验证崩溃,从而在扩展的训练范围内实现持续的性能改进。