论文
OPID:同策略 用于代理强化学习的技能 蒸馏
OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
摘要
基于结果的强化学习为语言代理提供了稳定的优化主干,但其稀疏的轨迹级奖励几乎无法提供关于应该强化或抑制哪些中间决策的指导。 同策略 自 蒸馏 提供密集的 词元级 监督,但现有的技能条件变体通常依赖于外部技能记忆或检索的特权上下文,维护成本高昂,并且可能与多轮交互中当前策略引起的状态分布不匹配。我们提出 \textbf{OPID} (\textbf{O}n-\textbf{P}olicy Sk\textbf{i}ll \textbf{D}istillation),一个直接从完整的 同策略 轨迹中提取技能监督的框架。 OPID 将轨迹后见之明表示为分层技能:事件级技能捕获全局工作流程或故障避免规则,而步骤级技能捕获关键时间步长的本地决策知识。当确定关键决策时,关键优先路由机制使用步骤级技能,否则会回退到事件级技能作为默认指导。所选技能被注入交互历史记录中,允许旧策略在原始和技能增强的上下文中对相同的采样响应重新评分。由此产生的对数概率偏移产生 词元级 自 蒸馏 优势,该优势与策略优化的结果优势相结合。因此,OPID 将强化学习保留为主要训练目标,同时引入密集的、分布匹配的事后监督。 ALFWorld、WebShop 和基于搜索的 QA 实验表明,与仅结果 RL 和现有技能 蒸馏 基线相比,OPID 通常可以提高代理性能、样本效率和鲁棒性。我们的代码可在 https://github.com/jinyangwu/OPID/tree/main 获取。