论文

EvoSkills:通过共同进化验证自我进化代理技能

EvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification

智能体系统Agent Skills

摘要

Anthropic 提出了 LLM 代理人的技能概念,以解决简单工具调用无法解决的多步骤专业任务。工具是单一的、独立的功能,而技能是相互依赖的多文件工件的结构化包。目前,技能生成不仅由于手动创作而属于标签密集型,而且还可能遭受人机认知失调的影响,这可能导致代理性能下降,正如 SkillsBench 上的评估所证明的那样。因此,我们的目标是让智能体能够自主生成技能。然而,现有的为工具设计的自我进化方法由于其复杂性增加而无法直接应用于技能。为了解决这些问题,我们提出了 EvoSkills,这是一个自我进化的技能框架,使代理能够自主构建复杂的多文件技能包。具体来说,EvoSkills 将迭代完善技能的技能生成器与代理验证器结合起来,后者共同进化以提供信息丰富且可操作的反馈,而无需访问真实测试内容。在 SkillsBench 上,EvoSkills 在 Claude Code 和 Codex 的五个基线中实现了最高的通过率,并且还对另外六个大语言模型展示了强大的泛化能力。

EvoSkills:通过共同进化验证自我进化代理技能
图 1:工具-技能差异说明。