论文

SkillForge:强化学习代理的可验证技能的发展

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents

智能体系统模型训练强化学习Agent SkillsAgentic RL

摘要

大语言模型 (LLM) 代理经过强化学习 (RL) 训练,可完成复杂的决策任务。然而,大多数强化学习训练的智能体仍然是情景性的,无法跨情景积累可重用的知识。最近基于技能的方法,例如 SkillRL,试图通过从原始轨迹中提取技能来解决这个问题,但将技能库视为仅附加存储库,而不验证存储的技能是否仍然有效。在本文中,我们提出了 SkillForge,这是一个持续技能进化的框架,可以通过环境交互来验证和完善技能。通过在代理交互过程中明确技能的使用,强化学习可以直接优化环境操作和技能调用决策。 SkillForge进一步引入了基于证据的技能验证和多途径技能归纳,使技能库在保持质量的同时不断增长。 ALFWorld、WebShop 和 AppWorld 上的大量实验表明,SkillForge 始终优于 SkillRL,证明了不断验证的技能在训练更强的 LLM 代理方面的有效性。