论文

SkillGrad:像梯度下降一样优化代理技能

SkillGrad: Optimizing Agent Skills Like Gradient Descent

智能体系统上下文与知识记忆Agent SkillsAgent记忆

摘要

代理技能通过在结构化文件中存储可复用的程序性知识,为把 LLM 代理适配到专门领域提供了一种轻量方式。然而,无论是从第三方下载还是自行生成的技能,往往都不可靠、不完整或过时。现有的技能演化方法常通过启发式反思来弥补这些缺陷,而缺乏显式的优化表述。本文提出 SkillGrad,一个受梯度下降启发的代理技能优化框架。SkillGrad 把技能包当作以梯度下降方式优化的结构化参数:任务执行提供轨迹级的损失证据,自动诊断随后给出指示纠正方向的基于文本的梯度。为了在迭代间稳定优化,一个动量代理把反复出现的诊断模式累积到持久的记忆覆盖层中。最后,一个基于 LLM 的补丁器通过对技能包施加层级感知的编辑来执行参数更新。在 SpreadsheetBench Verified 和 WikiTableQuestions 上评估,SkillGrad 在两个骨干 LLM 上持续优于基于训练的技能演化基线,相对最强的基于训练的基线平均提升 6.7 个百分点。消融实验进一步表明,动量与对比诊断都对最终技能质量有贡献。

SkillGrad:像梯度下降一样优化代理技能:论文配图
图 1:SkillGrad 概述。给定结构化技能和小批量训练任务,执行者会产生轨迹和结果。 SkillGrad 将失败的执行和对比成功的执行转化为损失证据,诊断可重复使用的更新信号,通过文本动量积累重复出现的模式,并应用分层感知补丁以获得下一个技能。