论文

进化的程序化技能网络

Evolving Programmatic Skill Networks

智能体系统Agent 工具调用Agent Skills

摘要

我们研究在开放式具体环境中持续获取技能,其中代理必须构建、完善和重用不断扩展的可执行技能库。我们介绍了程序化技能网络(PSN),这是一个框架,其中技能是可执行的符号程序,形成一个通过经验演变的组合网络。 PSN 定义了通过大语言模型实例化的三个核心机制:(1)REFLECT,用于对技能组合进行结构化故障定位;(2) 通过成熟度感知更新门控进行渐进优化,稳定可靠技能,同时保持不确定技能的可塑性;(3) 回滚验证下的规范结构重构,保持网络紧凑性。我们进一步表明 PSN 的学习动态与神经网络训练在结构上相似。 MineDojo 和 Crafter 上的实验展示了强大的技能重用、快速适应以及跨开放式任务分配的强大泛化能力。\footnote{我们计划开源代码。

进化的程序化技能网络 配图
图 1:程序化技能网络(Programmatic Skill Network, PSN)框架。智能体维护一个技能网络 N_t,混合规划器在其中选择或合成技能,由 PSN 管理器执行。失败时,技能优化器执行基于轨迹的信用分配;成功时,在线重构器对网络进行重构。这引发了类似神经网络训练的学习动力学:故障定位如同反向传播,成熟度门控如同学习率调度,重构如同架构搜索。