论文

大规模评估代理技能的框架

A Framework for Evaluating Agentic Skills at Scale

智能体系统Agent任务评测

摘要

代理技能——增强 LLM 代理能力的结构化、可重用的知识工件——已在行业中迅速采用,但其跨领域影响和跨商业和开源模型的使用仍未得到充分研究,并且不存在用于评估个人技能的可重用方法。在这项工作中,我们提出了一个评估框架,让技能作者构建现实任务来严格评估对他们最重要的技能方面,并通过解决这些任务来估计技能效用。此外,我们将评估方法大规模应用于 500 项现实技能,根据技能内容生成 1,000 项任务,以及遵循指令和目标完成评分标准。使用这些指标,我们评估了 19 种代理模型配置(专有的和开源的)在任务上的执行情况。我们的结果表明,模型在遵循技能编码指令的程度方面存在很大差异,从而导致其性能增益存在显着差异。此外,我们表明,与无技能设置相比,获得技能会显着改变模型行为,从而提供了将固执己见的工作流程编码到 LLM 代理中的基本机制。我们发布评估数据集以支持未来的代理技能工作。