论文
SkillsBench:跨多样任务评测 Agent Skills 的有效性
SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks
摘要
代理技能是程序知识的结构化包,可在推理时增强 LLM 代理。尽管采用速度很快,但没有标准方法来衡量它们是否真正有帮助。我们推出了 SkillsBench,这是涵盖 11 个领域的 86 项任务的基准,并配有精心策划的技能和确定性验证器。每项任务都在三种条件下进行评估:无技能、策划技能和自行生成技能。我们在 7,308 条轨迹上测试了 7 种代理模型配置。策划技能将平均通过率提高了 16.2 个百分点 (pp),但效果因领域而异(软件工程为 +4.5 个百分点,医疗保健为 +51.9 个百分点),并且 84 项任务中有 16 项显示负增量。平均而言,自我生成的技能没有提供任何好处,这表明模型无法可靠地创作它们从消费中受益的程序知识。具有 2--3 个模块的重点技能优于全面的文档,并且具有技能的较小模型可以与没有技能的较大模型相匹配。
