论文

RL2ML:从强化学习到最大似然的有限轨迹采样替代目标

RL2ML: Finite-Rollout Surrogate Objectives from Reinforcement Learning to Maximum Likelihood

模型训练强化学习

摘要

基于正确性的具有可验证奖励的强化学习(RLVR)根据采样输出的二进制反馈来训练语言模型,但期望优化的目标和有限轨迹采样组引起的随机更新几何结构经常被混为一谈。本文开发了 RL2ML,这是一系列有限轨迹采样代理目标,具有封闭形式、完全无偏的梯度估计器。该系列不断连接标准强化学习、类最大似然训练和超越最大似然目标,同时在固定的轨迹采样预算下保持估计器与目标的一致性。我们引入组级更新规模来描述在观察到经验成功计数后如何重新加权轨迹采样组,揭示仅由群体级客观符号隐藏的亚临界-超临界更新规模转变。基于这种区别,校准的度量增益分析和精确方差分解表明,替代目标的最佳选择既不是由接近最大似然度决定的,也不是仅由总体水平权重决定的。相反,它共同取决于评估指标、局部敏感性和估计方差。因此,代理目标族中的剩余自由度可以表示为一维优化问题,而不是视为无约束超参数。