论文

代理强化学习的动态技能生命周期管理

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning

模型训练智能体系统强化学习Agent SkillsAgentic RL

摘要

大语言模型 代理越来越依赖外部技能来解决复杂的任务,其中技能充当模块化单元,将其功能扩展到参数内存单独支持的范围之外。现有方法假设外部技能要么作为持续的指导而积累,要么内化到政策中,最终导致零技能推理。我们认为这种假设过于严格,因为参数能力有限且技能之间的边际贡献不均匀,最佳主动技能集是非单调的、任务和阶段相关的。在这项工作中,我们提出了 SLIM,一种用于代理强化学习(RL)的动态技能生命周期管理框架,它将主动外部技能集视为与策略学习共同更新的动态优化变量。具体来说,SLIM 通过留一技能验证来估计每个活跃技能的边际外部贡献,然后应用三个生命周期操作:保留高价值技能、在充分接触后退役其贡献可以忽略不计的技能,以及在持续故障揭示缺失的能力覆盖范围时扩展技能库。实验表明,在 ALFWorld 和 SearchQA 中,SLIM 的性能比最佳基线平均高出 7.1%。结果进一步表明,政策学习和外部技能保留并不相互排斥:一些技能被吸收到政策中,而另一些技能则继续提供外部价值,支持 SLIM 作为基于技能的代理强化学习的更通用范例。