论文

不断发展的企业人工智能Agent技能的持续流程级评估

Continuous Process-Level Evaluation for Evolving Enterprise AI Agent Skills

智能体系统Agent任务评测Agent Skills

摘要

企业人工智能Agent技能随着工具 API、模型和规范的变化而发展,但最终输出评估可能会错过流程级行为漂移。我们提出了一个结合结果级别和流程级别检查的持续评估框架,应用于企业价值感知弹性系统中业务价值确定技能的收入和生产力变体。该框架独立计算每次运行的基本事实,具体化可重用的模板测试,并通过编程检查和范围狭窄的 LLM 判断来评估Harness选择、参数、执行顺序和数据库完整性。我们评估了 240 项试验,涉及两种技能、两种规格变体、两种AgentHarness和三种模型。在通过所有适用的最终数值检查的 175 项试验中,162 项(92.6%;威尔逊 95% CI:87.7-95.6%)包含另一个评估者检测到的偏差。根据更广泛的七检查最终状态定义,164 次通过运行中的 151 次(92.1%;95% CI:86.9-95.3%)仍然违反了轨迹检查。依赖性归因将每次运行的平均失败检查次数从 6.34 次减少到 2.65 次。规格敏感性因模型和工具而异,探索性引导交互间隔在所有三个收入比较和三个生产力比较之一中排除零。运行时解析的模板提供了跨评估配置的可重用回归覆盖;实际 API 演变下的纵向验证仍然是未来的工作。