论文
SEED:用于代理强化学习的自我进化 同策略 蒸馏
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
摘要
大语言模型 越来越多地被训练为交互式代理,用于涉及多轮交互、工具使用和环境反馈的长期任务。基于结果的强化学习(RL)提供了一种实用的优化范式,但其稀疏的轨迹级奖励对中间决策提供的指导有限,从而在事件级结果和 词元级 策略学习之间留下了监督差距。我们提出 SEED(SElf-Evolving 同策略 蒸馏),这是一种自我进化框架,可将完整的 同策略 轨迹转换为训练时的事后技能,并将其行为效果提炼回政策模型。 SEED 首先对策略进行微调,以分析完整的轨迹并生成自然语言技能,以捕获可重用的工作流程、决定性的观察结果或故障避免规则。在强化学习期间,当前策略既收集轨迹,又充当分析器,从中提取事后技能。因此,政策更新可以共同改善后续决策和技能分析,从而使事后监督能够随着政策的发展而发展。然后,SEED 在普通和技能增强环境下对采样动作重新评分,将技能引起的概率变化转换为密集的 词元级 同策略 蒸馏 信号。该信号与基于结果的强化学习联合优化,使辅助监督与当前轨迹分布保持一致。对基于文本和基于视觉的代理任务的大量实验表明,SEED 不断提高性能和样本效率,对未见过的场景表现出强大的泛化能力。我们的代码可在 https://github.com/jinyangwu/SEED 获取。