论文

信号还是噪声?网页开发Agent Skills的基准研究

Signal or Noise? A Benchmark Study of Agent Skills in Web Development

智能体系统Agent任务评测

摘要

Agent Skills是可复用的程序性模块,用于向编码智能体提供框架约定、应避免的模式和工具。但注入每项技能都会扩大每次查询的提示,因此评测不仅要问能否完成任务,也要问是否有必要注入。WebDev-Skills-Bench对31项公开网页开发技能、50个Web-Bench项目和1000项有序任务开展受控研究,比较四种匹配条件,包括等长度无关内容对照与逐组件留一消融。提示仅包含SKILL.md,辅助文件挂载至工作区,以区分技能作用与提示长度影响。四种模型中,目标技能注入使平均Pass@2降低1.3%–4.2%,完成任务的进度降低,词元成本增加72%–394%;只有17%–36%的技能项目组合取得收益。等长度对照区分两类失败:部分模型被长度干扰,等长无关技能重现多数损失;另一些被内容误导,长度本身中性,但技能内容仍使Pass@2下降1.1%–1.4%。损失集中在早期简单任务,技能排名跨模型迁移较弱;有效技能中,避免错误模式的规则优于大量示例。结果提示应按技能、项目、模型的具体组合决定是否注入,并以长度匹配对照和分模型检查评估。