论文
揭秘Agent技能:它们为何有效——以及何时失效
Demystifying Agent Skills: Why They Work-Until They Don't
摘要
技能(Skills)已成为一种实用且有效的方法,通过结构化知识包在推理时增强LLM Agent。然而,现有评估大多衡量技能是否提升聚合任务成功率,一个更根本的问题仍未被充分探索:技能何时有帮助、为何有效、又在哪里失效?通过跨多个基准、Agent运行框架和LLM的受控实验,我们分离了技能的表征、结果标注、检索难度与跨框架鲁棒性的影响。为进一步回答该问题,我们设计了一项对比研究,将受控定量实验与配对轨迹分析相结合。我们规范化了来自受控实验的8,135条试验记录,并从240条开放编码记录中保留238个有效唯一标签。我们将这些观察整合为一个包含三个高层类别和十二种技能使用模式的分类法:技能之所以有效,是因为嘈杂的轨迹变成了稳定执行的程序性锚点。在匹配比较中,技能比Workflow Memory高6.06分。程序性锚定占技能案例的65.7%,而显式知识注入仅占4.5%,表明技能的作用是稳定行动而非注入缺失事实。检索是另一个瓶颈:当技能池从5增长到100时,实际使用精度从29.6%降至3.3%。易混淆的干扰项会损害离线识别,但下游成功率保持稳定;精确的真值调用既不充分也不必要。技能在假设脆弱、上下文不兼容或适应不足时失效。这些发现将评估推向聚合成功率之外,并指导可靠的自进化Agent。
