论文

SkillFlow:面向自主智能体终身技能发现与演化的基准测试

SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents

智能体系统Agent任务评测Agent Skills

摘要

随着自主智能体的能力边界不断扩展,它们越来越能够通过即插即用的外部技能完成专门任务。然而现有基准大多测试模型能否使用给定的技能,而对它们能否从经验中发现技能、在失败后修复技能并随时间维护一个连贯的技能库则悬而未决。我们提出SkillFlow,一个包含20个家族共166个任务的基准,其中每个家族内的任务构建遵循定义智能体工作流框架的领域无关执行流(DAEF),使这些任务共享一致的工作流。智能体在Agentic Lifelong Learning(智能体终身学习)协议下接受评估:它们从没有技能开始,在每个家族内依次解决任务,通过轨迹与评分准则驱动的技能补丁将经验外化,并携带更新后的技能库继续前行。实验揭示了显著的能力差距。对Claude Opus 4.6而言,终身技能演化将任务成功率从62.65%提升至71.08%(+8.43个百分点)。然而,高技能使用率并不必然意味着高效用:Kimi K2.5尽管技能使用率达66.87%,却仅获得+0.60个百分点,而Qwen-Coder-Next的任务完成率仅为44.58%,且相对无技能的原始设置仍出现退步。SkillFlow为这一方向贡献了一个结构化测试床,并对终身评估下的技能发现、打补丁、迁移及其失败模式进行了深入实证分析。

SkillFlow:面向自主智能体终身技能发现与演化的基准测试:论文配图
图 1:SkillFlow 的概念概述。该图将传统的静态技能评估与我们的终生环境进行了对比,其中代理将经验外化为可重用的技能工件,通过补丁对其进行修改,并将它们转移到共享公共 DAEF 的任务之间。