论文
SkillProx:经由近端文本梯度下降的智能体技能自演化
SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent
摘要
LLM智能体日益通过在技能中积累程序性知识来适应重复出现的任务。这些技能是轻量、可复用的文本制品,无需权重更新即可加载进智能体上下文。近期方法通过迭代任务执行、失败诊断和轨迹引导的文本空间更新来改进技能。然而,现有框架缺乏显式的诊断-结果反馈,并将删除视为一般性的编辑操作,而非整合已积累知识的专门机制。我们提出SkillProx,一个受近端梯度启发的正向-反向框架,将闭环诊断演化与效用感知的近端精炼耦合。在平衡任务损失与技能复杂度的复合目标驱动下,正向阶段在同一任务批次上重新执行诊断驱动的编辑、回滚发生退化的修改,并将实测结果反馈给后续诊断。反向阶段将所得技能分解为可审计的知识单元,用冻结的留一法效用审计估计其贡献,并执行经验证门控的合并、降级或移除。在多个骨干LLM的分布内与分布外基准上的实验表明,SkillProx较最强的基于梯度的基线将平均准确率提升3.0个百分点。组件消融证明了闭环诊断与近端精炼的互补效应。
