论文

ContinualSkillBench:LLM Agent真的能演化能力吗?

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

智能体系统Agent任务评测Agent Skills

摘要

现代代理框架为大语言模型配备了外部技能库,以解决复杂任务。然而,仍不清楚这些系统是否能够有效地进化其技能,并且这些技能是否能显著提升任务解决能力。为了填补这一差距,我们引入了ContinualSkillBench,这是一个动态评估框架,用于在上下文中进行持续技能学习。它覆盖了五个代表性领域,每个领域包含100个相互连接的子任务,按照难度递增和跨任务技能重用的机会顺序排列。我们的实验表明,序列执行通常会提高性能,但模型和领域的差异显著影响这些提升。此外,在-上下文学习与显式技能维护相比平均表现相当,这暗示大部分改进源于适应先前上下文和反馈,而不是单一重复技能抽象。然而,显式技能对于需要重复性过程或精确输出的任务仍然提供选择性的益处。我们进一步发现,能力较弱的模型倾向于积累更大的、更碎片化的任务特定技能集合。这些发现表明,当前在-上下文中的技能进化机制可以支持持续适应,但仍然难以一致地将经验转化为稳健且可转移的技能。

ContinualSkillBench:LLM Agent真的能演化能力吗?:论文配图
图 1:ContinualSkillBench 管道概述。第一阶段从五个领域收集大约 30,000 个任务。第 2 阶段使用 LLM 辅助过滤、技能依赖性分析、任务排序和人工审核来构建五个连续任务流。第 3 阶段通过指令、执行和反思来评估智能体,比较顺序执行和独立执行,并将其性能差异报告为 Δ\Delta。