论文
极端区域策略 蒸馏
Extreme Region Policy Distillation
摘要
大语言模型 的强化学习面临着样本效率和渐近性能之间的基本权衡:严格的 同策略 方法在单次更新后丢弃轨迹,而 离策略 重用会引入分布不匹配,现有的信任域技术主要通过强制保守优化来缓解这种分布不匹配,通常会导致丰富的训练信号未得到充分利用。为了调查这一点,我们对固定数据进行了广泛的 离策略 更新。我们的实验表明,积极的多步优化带来了快速的初始增益,但过度的更新会导致轨迹概率偏离和熵崩溃,性能很快就会趋于稳定。收紧 KL 约束只会降低上限,而不会解决退化问题。这激发了极端区域策略 蒸馏 (ERPD),这是一个将样本效率与 KL 效率解耦的两阶段框架。第一阶段对固定数据进行弱约束离策略优化,以最大限度地提取训练信号。由此产生的策略提供 词元级 监督。在第二阶段,我们在信任域约束下将这些信号提炼成基本策略,过滤有害漂移,同时保留有用信号。蒸馏策略以小得多的 KL 散度实现了可比较或更好的性能,这表明第一阶段的散度大部分花在了不必要的漂移上,而不是真正的改进上。至关重要的是,ERPD 能够适应强教师和弱教师:当积极的优化无法产生更强的政策时,即使是退化的教师也可以通过替代信号构建策略提供有效的监督。我们在数学推理上验证了 ERPD,显示了 同策略 训练停滞不前的强基础模型的收益,以及薄弱教师的可靠改进。