论文
通过强化学习渐进式代理技能生成
Progressive Agent Skill Generation via Reinforcement Learning
摘要
最近的 大语言模型 智能体经常使用外部技能作为模块化程序单元,以调节推理并改进复杂任务的解决。因此,从文档或经验中自动生成高质量的技能已成为一个重要问题。现有的技能生成方法很大程度上依赖于启发式或管道式整合,必须针对不同的证据源进行专门设计。相比之下,基于学习的方法提供了一种更统一的方法来建模跨异构源的技能生成。然而,基于学习的技能生成仍然具有挑战性,因为技能缺乏基于相关性或正确性的自然监督信号;它们的价值在很大程度上只能取决于它们是否改善了代理在下游任务中的行为。为了应对这一挑战,我们提出了Skill-$α$,这是一种强化学习方法,可以学习渐进式技能生成的统一策略。具体来说,我们通过将学习到的策略重复应用于连续的源证据来构建每项技能,并引入一种新颖的回滚奖励,通过比较锚定查询上原始技能和编辑技能下的下游执行来评估每次编辑。大量实验表明,在文档到技能和经验到技能设置中,Skill-$α$ 比基于启发式或管道的方法生成更有效的技能。在主要的 GPT-4o 工作线程下,Skill-$α$ 在 CL-Bench 上比最强技能生成基线提高了平均下游成功率 3.1 点,在 tau2-bench 上提高了 6.7 点。进一步的消融和分析验证了回滚奖励和渐进生成的重要性。