论文

AgentOPSD:用于智能体强化学习的递归自蒸馏

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

可验证奖励强化学习构造轨迹级优势,却常无法准确识别长程多轮智能体任务中决定结果的少数关键决策。AgentOPSD是无需价值评估器的递归回合级信用分配方法,将词元层的教师与学生对数概率差聚合为回合证据,在对数几率空间递归更新贝叶斯信念。连续状态间的边际信念变化用于识别关键回合,重新加权将稀疏结果监督转为回合贡献信号。方法兼容标准策略优化,无需额外价值评估器或执行轨迹。研究在ALFWorld、WebShop和Search-QA上评测3B与7B的Qwen2.5,优于GRPO及强自蒸馏基线,其中Qwen2.5-7B在ALFWorld上成功率89.1%。消融显示回合聚合与依赖历史的递归信念更新共同贡献改善。

AgentOPSD:Agentic强化学习的递归自蒸馏:论文配图
图 2:AgentOPSD 概述。左:代理循环,与环境交互轮流 1,…,K1,\dots,K。中:AgentOPSD 通过三个步骤将 GRPO 的单一序列级优势转化为回合级重塑优势:(1)将回合内标记级师生差距 δk,t\delta_{k,t} 聚合为回合级差距 eke_{k}; (2) 递归更新信念状态 BkB_{k} (从组成功率初始化)并读出其边际修正 Δ​Bk=Bk−Bk−1\Delta B_{k}=B_{k}-B_{k-1}; (3) 将每回合的序列级优势 As​e​q(i)A^{(i)}_{seq} 重塑为 A~k(i)\tilde{A}^{(i)}_{k}。右图:普通 GRPO 向每个令牌/回合广播相同的 As​e​q(i)A^{(i)}_{seq}。每个记号 kk 又继承 A~k\tilde{A}_{k}。