论文
SkillOS:为自进化智能体学习技能治理
SkillOS: Learning Skill Curation for Self-Evolving Agents
摘要
基于 LLM 的代理越来越多地被部署来处理流任务,但它们通常仍然是一次性的问题解决者,无法从过去的交互中学习。从经验中提炼出来的可重用技能为自我进化提供了天然的基础,其中高质量的技能管理是关键瓶颈。现有方法要么依赖于手动技能管理,规定启发式技能操作,要么训练短期技能操作。然而,他们仍然难以从间接和延迟的反馈中学习复杂的长期管理政策。为了应对这一挑战,我们提出了 SkillOS,这是一种经验驱动的 RL 训练方法,用于学习自我进化代理的技能管理。 SkillOS 将一个用于检索和应用技能的冻结代理执行器与一个可训练的技能管理者配对,后者根据积累的经验更新外部 SkillRepo。为了提供用于管理的学习信号,我们设计了复合奖励,并根据与技能相关的任务依赖性对分组任务流进行训练,其中早期的轨迹更新 SkillRepo,稍后的相关任务评估这些更新。在多轮代理任务和单轮推理任务中,SkillOS 在有效性和效率方面始终优于无记忆和基于强记忆的基线,并且学习的技能管理者可以跨不同的执行器主干和任务域进行泛化。进一步的分析表明,学习的管理者会产生更有针对性的技能使用,而 SkillRepo 中的技能会随着时间的推移演变成结构更丰富的 Markdown 文件,对更高级别的元技能进行编码。
