论文

SkillAudit:从固定套件基准到以技能为中心的评估

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

模型评测智能体系统AI 基础设施Agent SkillsSandbox评测方法与指标Agent Sandbox

摘要

智能体技能已成为扩展大语言模型智能体的实用方式——但不断增长的技能生态仍缺乏判断一个技能是否值得部署的可靠方法。既有评估方法仍大多锚定固定任务套件——通过在预定义任务与环境上的性能评估技能。随技能市场扩张——该范式变得不足:固定套件可能把技能的边际贡献与骨干强度混淆——并在任务超出技能预期范围时错失其价值。我们介绍SkillAudit——以技能为中心的评估端到端框架:以任意智能体技能为输入——自动生成横跨效用、效率/成本与安全的多维综合评估报告。SkillAudit聚焦技能工件本身——直接从技能包构建能力对齐的评估任务。生成的任务在隔离沙箱环境中执行以收集执行证据——随后经基于LLM裁判的自动化检查产出可审计结果。为剖析智能体技能——我们提出基线比较原则以度量效用与效率/成本——并引入静态语义分析加动态运行时验证的两阶段检测范式评估安全风险。扫描横跨23个职业类别的顶级真实技能包后——我们发现超过7%的技能处于风险状态。

SkillAudit:从固定套件基准到以技能为中心的评估:论文配图
图 1:SkillAudit 将评估集中在每个技能工件上,而不是在固定任务套件上对技能进行基准测试,从而提供多维度的评估报告。