论文

AlphaEval:评估生产中的代理

AlphaEval: Evaluating Agents in Production

智能体系统Agent任务评测

摘要

人工智能代理在商业环境中的快速部署已经超过了反映生产现实的评估方法的发展速度。现有的基准通过具有明确要求和确定性指标的回顾性策划的任务来衡量代理的能力,这些条件与生产环境根本不同,在生产环境中,要求包含隐式约束,输入是异构多模式文档,信息分散在各个来源,任务需要未声明的领域专业知识,输出是长期的专业可交付成果,成功是由标准随着时间不断变化的领域专家来判断的。我们推出了 AlphaEval,这是一个基于生产的基准测试,包含 94 项任务,这些任务来自七家在其核心业务中部署人工智能代理的公司,涵盖六个 O*NET(职业信息网络)领域。与以模型为中心的基准测试不同,AlphaEval 将完整的代理产品(Claude Code、Codex 等)作为商业系统进行评估,捕获模型级评估不可见的性能变化。我们的评估框架涵盖多种范式(LLM-as-a-Judge、参考驱动指标、形式化验证、基于评分标准的评估、自动化 UI 测试等),各个领域组成多个范式。除了基准本身之外,我们还提供了一个从需求到基准的构建框架——一种系统方法,可以在最短的时间内将真实的生产需求转化为可执行的评估任务。该框架标准化了从需求到评估的整个流程,提供了一个可重复的模块化流程,任何组织都可以采用该流程为自己的领域构建基于生产的基准。