论文

SkillCAT:LLM 代理的对比、评估增强和拓扑感知技能自我进化

SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents

智能体系统Agent Harness

摘要

LLM智能体的技能自我进化方法旨在将执行轨迹转化为可重用的技能文档。然而,当前的管道通常从每个任务的单个轨迹中派生技能补丁,不加区别地合并它们,并在推理过程中加载整个技能语料库。这些选择导致不可靠的证据提取、低质量甚至有害的技能编辑的积累,以及由于不相关或冲突的技能内容而导致上下文使用效率低下。我们提出了 SkillCAT,一个将这个过程分解为三个阶段的框架。 (1) 对比因果提取 (CCE) 对每个任务的多个轨迹进行采样,并对比相同任务的成功/失败对,以找到解释结果差异的证据。 (2)评估增强进化(AAE)在源任务克隆上重放每个候选补丁,仅保留那些不损害任务结果的补丁,然后分层合并保留的补丁。 (3)拓扑感知任务执行(TTE)将进化的技能编译成可路由的子技能拓扑,以便推理仅加载与任务相关的能力节点。我们在广泛使用的代理基准(包括 SpreadsheetBench、WikiTableQuestions 和 DocVQA)上评估 SkillCAT,并进一步评估跨模型和分布外泛化。在这些设置中,SkillCAT 将初始技能的平均分数提高了高达 49.69%,证明了可靠且有效的技能演变。