论文

揭秘Agent技能:它们为何有效——以及何时失效

Demystifying Agent Skills: Why They Work-Until They Don't

模型评测智能体系统Agent Skills模型行为与机制分析

摘要

技能(Skills)已成为一种实用且有效的方法,通过结构化知识包在推理时增强LLM Agent。然而,现有评估大多衡量技能是否提升聚合任务成功率,一个更根本的问题仍未被充分探索:技能何时有帮助、为何有效、又在哪里失效?通过跨多个基准、Agent运行框架和LLM的受控实验,我们分离了技能的表征、结果标注、检索难度与跨框架鲁棒性的影响。为进一步回答该问题,我们设计了一项对比研究,将受控定量实验与配对轨迹分析相结合。我们规范化了来自受控实验的8,135条试验记录,并从240条开放编码记录中保留238个有效唯一标签。我们将这些观察整合为一个包含三个高层类别和十二种技能使用模式的分类法:技能之所以有效,是因为嘈杂的轨迹变成了稳定执行的程序性锚点。在匹配比较中,技能比Workflow Memory高6.06分。程序性锚定占技能案例的65.7%,而显式知识注入仅占4.5%,表明技能的作用是稳定行动而非注入缺失事实。检索是另一个瓶颈:当技能池从5增长到100时,实际使用精度从29.6%降至3.3%。易混淆的干扰项会损害离线识别,但下游成功率保持稳定;精确的真值调用既不充分也不必要。技能在假设脆弱、上下文不兼容或适应不足时失效。这些发现将评估推向聚合成功率之外,并指导可靠的自进化Agent。

揭秘Agent技能:它们为何有效——以及何时失效:论文配图
(a) 技能与程序性记忆对比流程。(b) 三项实验的技能检索评估。图1:实验流程。上:技能与程序性记忆对比。我们在固定的 Docker 环境中执行每个任务,收集成功与失败的轨迹,并构建固定预算的组合网格。同一轨迹池要么被蒸馏为 Workflow Memory,要么被蒸馏为可复用的 SKILL.md,然后在相同协议下于匹配任务上进行评估。下:技能检索。每个任务与一个候选池配对,池中包含其真实(ground-truth)技能与 k−1 个真实干扰项(随机、相似或不相似)。匹配的池通过三种流程独立评估:(A) 不执行任务的基于嵌入的排序;(B) 不进行 Docker 执行或验证的显式智能体选择;(C) 任务验证后进行技能使用解析的全池真实执行。(A) 与 (B) 的输出不会传递给 (C)。