论文

Talk, Evaluate, Diagnose:结合自动错误分析的用户感知智能体评估

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

智能体系统Agent任务评测

摘要

智能体应用正被越来越多地用于自动化跨多种任务的工作流。然而,由于其运行领域的异构性,构建可扩展的评估框架颇具挑战。已有工作各自采用不同的方法判定任务成功,如数据库查询、正则匹配等,增加了开发统一智能体评估方法的复杂度。此外,它们未能系统性地考虑用户在交互中的角色与专业水平,对智能体性能的洞察不完整。我们认为,有效的智能体评估不应止于正确性,还应纳入对话质量、效率以及对智能体错误的系统化诊断。为此,我们提出TED框架(Talk, Evaluate, Diagnose)。(1)Talk:我们利用可复用、通用的专家与非专家用户角色模板进行用户—智能体交互。(2)Evaluate:我们对现有数据集进行改造,将子目标(如工具签名)和回复表示为自然语言评分要点,并用LLM-as-a-judge自动评估。我们提出新的指标,同时刻画轮次效率与智能体的中间进展,与用户感知设置互为补充。(3)Diagnose:我们引入一个自动化错误分析工具,分析裁判与智能体的不一致之处,揭示常见错误,并提供可操作的智能体改进反馈。我们展示TED框架能够就智能体在不同模型与用户专业水平下的表现揭示新洞察。我们还证明,在将识别出的错误补救措施纳入智能体设计后,智能体性能在所提指标上最高可提升8-10%。

Talk, Evaluate, Diagnose:结合自动错误分析的用户感知智能体评估:论文配图
图 1:我们提出的两步自动错误发现方法,可根据判断和代理的不一致自动识别代理的常见错误。相同的错误颜色表示相似的低级错误聚集到相同的高级类别中。