论文
SkillGLoW:长程任务流中自改进智能体的过程家族技能整合
SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams
摘要
LLM 代理越来越多地通过编写和重用文本技能来自我改进,将其保存为一份全局文档或每个任务条目的统一池,尽管大多数证据来自具有结构相似任务的领域。在每个任务需要不同解决方案的长期工作负载中,这两种形式会以相反的方式失败:文档崩溃为通用规则,而池膨胀并且其条目仍绑定到编写它们的实例。我们认为,缺失的重用单元是由一组相关任务共享的解决过程,并围绕它构建 SkillGLoW(全局-局部编织):任务从其自身执行中写入的本地技能被聚合到过程族中,并压缩为去实例化的全局先验,而它们保存的实例细节是根据任务重新生成的,而不是存储的;仅当实际执行表明它不会降低已部署的库的性能时,提交门才会承认先验。在四个基准(数学推理、终端自动化、软件修复和体现控制)和三个模型中,先验平均比无技能基线获得 17.2 分(困难),在所有 12 次持续改进运行中都获得正收益,并且本地再生获得 18.0 分,而该库为每个程序系列保留一个先验,比每个任务池紧凑 3.6 倍。在相同的协议下,GLoW 在 21 个单元中的 15 个单元上领导了一个已发布的单文档优化器。未经修改,该库将未见过的 ALFWorld 任务的成功率从 73.9% 提高到 83.9%,这证明传输的是过程而不是任务内存。
