论文

SkillsBench:跨多样任务评测 Agent Skills 的有效性

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

智能体系统Agent任务评测Agent Skills

摘要

代理技能是程序知识的结构化包,可在推理时增强 LLM 代理。尽管采用速度很快,但没有标准方法来衡量它们是否真正有帮助。我们推出了 SkillsBench,这是涵盖 11 个领域的 86 项任务的基准,并配有精心策划的技能和确定性验证器。每项任务都在三种条件下进行评估:无技能、策划技能和自行生成技能。我们在 7,308 条轨迹上测试了 7 种代理模型配置。策划技能将平均通过率提高了 16.2 个百分点 (pp),但效果因领域而异(软件工程为 +4.5 个百分点,医疗保健为 +51.9 个百分点),并且 84 项任务中有 16 项显示负增量。平均而言,自我生成的技能没有提供任何好处,这表明模型无法可靠地创作它们从消费中受益的程序知识。具有 2--3 个模块的重点技能优于全面的文档,并且具有技能的较小模型可以与没有技能的较大模型相匹配。

SkillsBench:跨多样任务评测 Agent Skills 的有效性
图2:SkillsBench 流水线概览。阶段 1(基准构建):我们从三个来源聚合 Skill——开源仓库(12,847)、Claude Code 生态系统(28,412)和企业合作伙伴(5,891)——去重后得到 47,150 个唯一的 Skill。与此同时,322 名贡献者提交了 105 个候选任务。阶段 2(质量过滤):每个任务都要经过自动检查(结构有效性、AI 检测、泄漏审计)和人工评审(数据有效性、任务真实性、oracle 质量、Skill 质量、反作弊),最终产生覆盖 11 个领域的 84 个任务。阶段 3(评估):任务在三种条件(无 Skill、使用精选 Skill、自生成 Skill)下、跨三个商业 agent harness(Claude Code、Gemini CLI、Codex CLI)执行。确定性的 pytest 验证器产生通过/失败结果;7 种 agent-模型配置共产生 7,308 条轨迹,其中精选 Skill 带来平均 +12.66pp 的提升。