论文
AgentOPSD:用于智能体强化学习的递归自蒸馏
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
摘要
可验证奖励强化学习构造轨迹级优势,却常无法准确识别长程多轮智能体任务中决定结果的少数关键决策。AgentOPSD是无需价值评估器的递归回合级信用分配方法,将词元层的教师与学生对数概率差聚合为回合证据,在对数几率空间递归更新贝叶斯信念。连续状态间的边际信念变化用于识别关键回合,重新加权将稀疏结果监督转为回合贡献信号。方法兼容标准策略优化,无需额外价值评估器或执行轨迹。研究在ALFWorld、WebShop和Search-QA上评测3B与7B的Qwen2.5,优于GRPO及强自蒸馏基线,其中Qwen2.5-7B在ALFWorld上成功率89.1%。消融显示回合聚合与依赖历史的递归信念更新共同贡献改善。
