论文

CoSkill:推理与元技能智能体的联合强化学习以实现分层技能演化

CoSkill: Joint Reinforcement Learning of Reasoning and Meta-Skill Agents for Hierarchical Skill Evolution

模型训练智能体系统强化学习Agent Skills智能体自我改进Agentic RL

摘要

技能库通过使大型语言模型(LLM)智能体能够重用程序知识来提高智能体强化学习(RL)的样本效率。然而,现有范式表现出结构性缺陷:它们要么将技能演化与策略优化脱钩,要么将元技能实例化为固定工作流程。两者都将技能视为需要管理的被动对象,限制了技能的灵活演化及其与推理智能体的协同适应。为了解决这些限制,我们提出了 CoSkill,一个统一的多智能体 RL 框架,它将静态元技能工作流程重新设计为可学习的元技能智能体,并在分层技能库上与推理智能体联合训练它。通过将推理和元技能智能体建模为共享单一主干的合作团队,CoSkill 实现了端到端的协同适应:推理智能体根据检索到的任务技能和从其子集中选择的步骤技能来调整其操作,而其任务性能指导元技能智能体完善这些步骤技能。 ALFWorld 和 WebShop 上的实验表明,CoSkill 的性能大大优于先前基于技能的基线和 RL 基线,分别实现了 98.4% 和 90.6% 的成功率(+3.5 和 +6.2 pp)。如图 1 所示,CoSkill 实现了卓越的早期样本效率、渐近性能和挂钟效率。我们的代码可在此 https URL 获取。

CoSkill:推理与元技能智能体的联合强化学习以实现分层技能演化:论文配图
图 2:技能进化范例。 (a) 外部协调将技能发展与政策学习脱钩。 (b) 强化学习以粗粒度管理技能库操作。 (c) 固定的元技能工作流程优化个人技能,无需政策共同适应。 (d) CoSkill 联合训练推理智能体和元技能智能体,以实现细粒度的技能-策略协同进化。