论文

分层推理奖励下 Transformer 强化学习的最优率

Reinforcement Learning for Hierarchical Reasoning Rewards: Minimax-Optimal Rates with Transformers

模型训练强化学习

摘要

强化学习(RL)已成为 后训练语言模型在推理任务上的标准工具,其中策略在探索响应空间的同时通过奖励反馈进行更新。尽管在实证上取得了成功,但对 RL 后训练的理论理解仍然有限,特别是为什么策略探索与神经奖励模型相结合是有效的。在本文中,我们通过将奖励建模为响应空间上的分层函数来解决这个问题:奖励由无限多个局部组件组成,每个组件只有在前面的组件得到解决后才变得相关。我们展示了一种自然的基于 Transformer 的 执行模型-critic 算法,该算法在从当前 KL 正则化的策略采样、将 Transformer 批评家拟合到观察到的奖励和更新策略之间交替,在查询预算和正则化强度达到对数因子方面实现了极小极大最优率,并且对于固定数量的提示来说是极小极大最优。相比之下,我们证明从固定参考分布中采样(如离线奖励建模中那样)可以将后悔衰减限制在对数率。这些结果表明,策略上的探索逐渐放大奖励集中的区域,并量化其对 RL 后训练的好处。