论文

Agent Skills对下游任务的实际作用:一项实证研究

An Empirical Study of Agent Skills' Downstream Utility

智能体系统Agent任务评测Agent Skills长程任务评测

摘要

Agent Skills将操作指导和相关资源打包,以便重复使用,但与任务相关的Skill未必能改善任务表现。现有研究描述了Skill内容并评测其下游效果,却较少解释这种效果如何受到内容、执行配置和多个Skill组织方式的影响。我们对87项SkillsBench任务开展实证研究,将下游效用定义为:在相同模型与Harness配置下,同一任务使用Skill与不使用Skill的通过率之差。我们先在九种配置中比较同一组Skills,再在其中三种配置中研究同一任务的其他已发布Skills,以及固定Skill集合的不同组织方式。候选Skills从包含37,596项Skills的精选市场语料库中检索获得。我们借助LLM分析内容、执行轨迹和最终产物,再由作者复核,以考察所提供的支持如何被实际使用,并与任务结果建立联系。在36.78%的任务中,同一Skill对某些配置有帮助,却会损害另一些配置的表现;执行轨迹显示,推荐的操作流程可能成为额外负担。按相关性排序也会遗漏更有用的候选项。在所评测的候选集合内,按照对任务所需操作的支持程度重新排序,使三种配置下首选Skill的通过率提高4.35—5.80个百分点。我们归纳出17项编写建议,将可执行步骤与故障恢复、任务要求的保留及最终产物检查相联系。阶段计划和依赖有向无环图(DAG)优于仅指定使用顺序,其中DAG的额外收益主要出现在同时提供五到六项Skills的任务中。这些发现建议开发者评估Skill能否提供实际可用的操作支持,在保留任务要求的前提下允许调整执行流程,并在组织Skills时明确产物间的依赖关系。

Agent Skills对下游任务的实际作用:一项实证研究:论文原图
图 1. Agent技能效用实证研究概述。实证研究概述。共享技能语料库、任务基准和实验设置支持关于模型Harness配置、同一任务的替代技能和多技能组织的三个研究问题。内容和轨迹分析将观察到的效用差异与技能创作实践联系起来。