论文

信任批量、On- 或 离策略:RL 的自适应策略优化 后训练

Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training

模型训练强化学习

摘要

强化学习在结构上比监督学习更难,因为策略改变了它学习的数据分布。由此产生的脆弱性在大型 模型训练 中尤其明显,其中训练和部署系统在数值精度、采样和其他实现细节方面存在差异。现有方法通过向训练目标添加超参数来管理这种脆弱性,这使得算法对其配置更加敏感,并且每当任务、模型规模或分布不匹配发生变化时都需要重新调整。这种脆弱性可以追溯到两个问题,即当前目标在训练开始之前设置的超参数所纠缠在一起:信任区域问题,即更新不应使策略偏离其当前值太远,以及 离策略 问题,即来自较旧或不同行为策略的数据应仅在保持可靠的情况下影响更新。这两个问题都不是预先设定的常数,其严重程度反映在当前批次的政策比率分布中。我们提出了一个简单而有效的批量自适应目标,用政策比率的归一化有效样本量代替固定裁剪。相同的统计量限制了得分函数权重并设置了 离策略 正则化器的强度,因此当比率接近均匀时,更新保持接近通常的 同策略 得分函数更新,并且当陈旧或不匹配的数据导致比率集中时自动收紧,同时在高比率词元上保留非零学习信号。各种设置的实验表明,我们的方法匹配或超过了调整的基线,没有引入新的客观超参数并删除了几个现有的超参数。代码可在 https://github.com/FeynRL-project/FeynRL 获取。