论文

SkillProx:经由近端文本梯度下降的智能体技能自演化

SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

智能体系统Agent Skills

摘要

LLM智能体日益通过在技能中积累程序性知识来适应重复出现的任务。这些技能是轻量、可复用的文本制品,无需权重更新即可加载进智能体上下文。近期方法通过迭代任务执行、失败诊断和轨迹引导的文本空间更新来改进技能。然而,现有框架缺乏显式的诊断-结果反馈,并将删除视为一般性的编辑操作,而非整合已积累知识的专门机制。我们提出SkillProx,一个受近端梯度启发的正向-反向框架,将闭环诊断演化与效用感知的近端精炼耦合。在平衡任务损失与技能复杂度的复合目标驱动下,正向阶段在同一任务批次上重新执行诊断驱动的编辑、回滚发生退化的修改,并将实测结果反馈给后续诊断。反向阶段将所得技能分解为可审计的知识单元,用冻结的留一法效用审计估计其贡献,并执行经验证门控的合并、降级或移除。在多个骨干LLM的分布内与分布外基准上的实验表明,SkillProx较最强的基于梯度的基线将平均准确率提升3.0个百分点。组件消融证明了闭环诊断与近端精炼的互补效应。

SkillProx:经由近端文本梯度下降的智能体技能自演化:论文配图
图1:SkillProx流程。前向阶段迭代地执行、诊断并修补当前技能,利用同批次重执行来接受有益更新,或结合结果反馈回滚被拒绝的更新。在K次更新后,后向阶段在固定验证集上审计知识单元的效用,并应用经验证门控的巩固、降级或删除。被接受的编辑产出最终技能X^⋆。