论文
AgentEval:具有错误传播跟踪功能的代理工作流的 DAG 结构步骤级评估
AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
摘要
将推理、工具使用和合成链接到多步骤工作流程中的代理系统正在进入生产阶段,但流行的评估实践(例如端到端结果检查和临时跟踪检查)系统性地掩盖了主导现实世界错误预算的中间故障。我们提出了 AgentEval,一个将代理执行形式化为评估定向无环图 (DAG) 的框架,其中每个节点都带有由校准的 LLM 法官 (GPT-4o) 评估的类型化质量指标,通过分层故障分类法(3 个级别,21 个子类别)进行分类,并链接到上游依赖项以自动进行根本原因归因。消融研究隔离了基于 DAG 的依赖性建模的影响:与使用相同的法官和评分标准的平坦步骤级评估相比,仅它就为故障检测召回率贡献了 +22 个百分点,为根本原因准确性贡献了 +34 个百分点。在三个生产工作流程(450 个测试用例、两个代理模型系列,主要是具有 12% 非 DAG 跟踪率的顺序架构)中,AgentEval 实现了比端到端评估高 2.17 倍的故障检测召回率(0.89 比 0.41),Cohen 的 kappa = 0.84 与人类专家的一致性,以及 72% 的根本原因准确度(相对于 81% 的人类上限)。对 tau-bench 和 SWE-bench 轨迹的跨系统评估证实了可转移性(故障检测召回率 >= 0.78),无需分类或标题修改。由 18 名工程师参与的为期 4 个月的试点通过 CI/CD 集成回归测试检测到 23 个预发布回归,将根本原因识别时间中值从 4.2 小时缩短到 22 分钟,并在两个工作流程中显着降低了故障率。