论文

PR-OPD:用于Agentic强化学习的特权表示on-policy自蒸馏

PR-OPD: Privileged Representation On-policy Self-Distillation for Agentic Reinforcement Learning

摘要

语言模型智能体通常通过每集一个奖励的强化学习进行训练,而特权自我蒸馏通过让相同的策略在给定技能的情况下通过词元概率来教授其无技能的自我来丰富它。然而,我们发现了两个质疑该渠道的现象。隐形优势:上下文技能将 WebShop 的成功率从 42.2% 提升到 56.2%,但改变了不到四分之一的采样词元的概率。多方面对齐:一项技能改变了超过 80% 的响应标记的隐藏状态,线性探针可以追溯到特定技能。为了利用这一点,我们提出了特权表示策略自蒸馏(PR-OPD)。 GRPO 热启动后,该策略为每个轨迹编写一个后见之明技能,作为停止梯度教师重新读取该技能自己的响应,并将其预测的隐藏状态与奖励目标一起在每一层与教师的状态对齐,无需外部技能库、单独的教师或推理开销。在具有两个骨干网的 ALFWorld 和 WebShop 上,PR-OPD 在每种设置中都取得了最佳总体结果,在 ALFWorld 成功率方面比 GRPO 提高了 4.7 分,在 WebShop 准确度方面提高了 14.0 分。代码可在 https://github.com/balibata/PR-OPD. 获取