论文
自动化代理评估的实证研究
An Empirical Study of Automating Agent Evaluation
摘要
代理评估需要评估复杂的多步骤行为,涉及工具使用和中间推理,这使得其成本高昂且需要大量专业知识。一个自然的问题出现了:前沿编码助手能否可靠地自动化此评估过程?我们的研究表明,仅仅提示编码助手不足以完成这项任务。如果没有特定领域的评估知识,前沿编码助手只能实现 30% 的执行成功率,并产生平均每个智能体 12 个以上指标的过度设计的评估,这表明强大的编码能力不会自动转化为可靠的智能体评估。我们推出了 EvalAgent,这是一种人工智能助手,可以自动化端到端代理评估管道。 EvalAgent 将评估领域专业知识编码为评估技能(程序指令、可重用代码和模板以及动态检索的 API 文档),这些技能组成基于跟踪的管道,生成完整的评估工件,包括指标、可执行代码和报告。为了系统地评估生成的评估,我们引入了一个元评估框架以及 AgentEvalBench,这是一个由 20 个代理组成的基准,每个代理都配有评估要求和测试场景。我们进一步提出 Eval@1 指标来衡量生成的评估代码是否在第一次运行时执行并产生有意义的结果。我们的实验表明,EvalAgent 可以进行有针对性的评估,将 Eval@1 从 17.5% 提高到 65%,并且比基线方法实现了 79.5% 的人类专家偏好。进一步的消融研究表明,评估技能对于处理复杂的评估至关重要:删除它们会导致 Eval@1 从 65% 显着下降到 30%。