论文

AEVAL:从轶事到代理技能工作流程的确定性测试

AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows

模型评测智能体系统Agent Skills评测方法与指标

摘要

现代代理系统越来越依赖于技能:可安装的自然语言和代码包,用于教导 LLM 代理执行域任务。随着技能存储库的增长,开发人员需要针对每次更改提供自动质量信号,但如今的评估很大程度上是轶事:开发人员要求代理“尝试该技能”,观看演示,并形成主观印象。这既不会产生运行之间的可重复性,也不会产生版本之间的可比性,并且很难扩展到市场,在市场中,一次回归可能会悄悄地破坏数十个下游工作流程。我们提出了 AEVAL(代理评估),这是一个 CI 集成框架,它用确定性的、可重复的代理技能测试管道取代了这种做法。每个技能更改都会触发一个测试事件:该技能会根据开发人员在自动执行器内声明的评估合同运行,发出下游 CI 可以路由的结构化、基于证据的质量信号。一个关键因素是执行器和评分器之间的结构分离,防止微妙但普遍的失败模式:代理在执行过程中默默地进行自我纠正,然后将其自己的修补输出评分为通过。我们的贡献是:(i) 一个确定性的、由变更触发的评估协议,具有每个技能合同和每个运行工件模式; (ii) 将自我修正偏差形式化为天真的代理评估者的一种独特的失败模式; (iii) 执行者/分级者分离,具有首次尝试分级规则和明确的自我校正跟踪; (iv) 作为内联合并请求评论发布的分层、基于证据的修复建议方案(LV1 因果,LV2 质量)。 AEVAL 通过跨多个代理 SDK 的生产代理堆栈的真实技能进行验证,将虚假的 100% 通过率转换为可重现的首次尝试失败信号,并提供每个执行程序修复的可审核记录。