论文
评估技能,而不只是智能体:技能的Agentic持续评估
Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills
摘要
企业智能体项目正从原型走向生产,在那里可复用技能、工具和工作流包必须以证据而非文字来评审。当前的门禁常常扫描这些工件的结构、风格和安全性,但不回答部署问题:该能力包是否帮助一个在线智能体在同样的模型、沙箱和评分策略下完成企业任务?我们提出ACES(Agentic Continuous Evaluation of Skills),一个仓库原生框架,用于把技能和产品能力包当作可执行的智能体工件来评估。ACES运行有/无目标技能的成对在线试验,把轨迹规范化为智能体轨迹交换格式(ATIF),对六项默认运行时指标评分,并报告Skill Lift:目标技能在固定的任务、harness、工作区和评分器下带来的附加价值。同一协议支持产品自有任务套件,比较基线、技能、捆绑包、团队技能和插件目标。在来自内部企业仓库和公开目录的145个真实技能上,仅扫描门禁能发现有用的编写问题,但度量的是互补的侧面(结构对比LLM评审的Spearman ρ= 0.14)。在来自64个生产技能中的58个和四个主要harness的947个评分成对案例中,平均复合Skill Lift为0.2134(95%成对案例CI [0.1967, 0.2301]);仅结果提升度(准确率与目标达成准确率的平均)的均值为0.1799。复合提升度在72.8%的成对案例中为正。过程指标的最大增益出现在技能执行、行为检查和技能效率上——这些关于发现、路由、工作流遵循和工具使用的信号是文档扫描无法观察到的。该方法论的开源实现见NVIDIA SkillEvaluator。