论文
Skill-R1:通过强化学习进行代理技能进化
Skill-R1: Agent Skill Evolution via Reinforcement Learning
摘要
Agentic 大语言模型 通常依赖于指导规划、行动和工具使用的技能、可重复使用的自然语言程序。在实践中,通常通过即时工程或通过调整任务 LLM 本身来提高技能,但这种方法成本高昂、特定于模型,并且对于闭源模型通常不可行。技能优化不是一个单步问题,而是一个具有两个耦合级别的贡献分配的循环过程:有用的技能必须提高当前条件下的采样轨迹质量,而有用的修订必须将观察到的结果转变为下一轮更好的技能。我们提出了 Skill-R1,这是一种强化学习框架,用于通过可验证的奖励来优化实例级循环技能。 Skill-R1 不是更新任务 LLM,而是训练一个轻量级技能生成器,该生成器以任务上下文、先前的部署及其经过验证的结果为条件,以生成引导冻结任务 LLM 的技能。这保留了与开源和闭源模型的黑盒兼容性,同时使适应比模型级更新便宜得多。 Skill-R1 会进行多代:在每一步,当前技能都会引发部署,其经过验证的结果会被反馈以产生下一个修订。为了优化这个循环过程,我们引入了结合代内和代间优势的双层群体相关策略优化目标。代内术语比较共享技能条件下的采样轨迹,而代际术语则奖励改善连续几代人行为的修订。这些共同为定向技能发展提供了原则性目标,而不是一次性的自我完善。根据经验,Skill-R1 在跨基准的无技能基线和标准 GRPO 上取得了一致的收益,并具有可验证的奖励,尤其是在复杂的多步骤任务上有显着的改进。