论文
AI智能体的整体评估与失败诊断
Holistic Evaluation and Failure Diagnosis of AI Agents
摘要
AI智能体执行复杂的多步骤过程,但当前评估存在不足:结果指标只报告成功或失败而不解释原因,过程级方法又难以将失败类型与长而结构化的轨迹中的确切位置关联起来。我们提出一个整体智能体评估框架,将自顶向下的智能体级诊断与自底向上的片段级评估相结合,把分析分解为相互独立的逐片段评估。这种分解可扩展到任意长度的轨迹,并为每个判定产出片段级依据。在TRAIL基准上,我们的框架在GAIA与SWE-Bench的所有指标上均取得最先进结果,相对最强既有基线的相对增益包括:类别F1最高38%,定位准确率最高3.5倍,联合定位-分类准确率最高12.5倍。分类别分析显示,我们的框架在更多错误类别上领先于任何其他评估器。值得注意的是,同一前沿模型在我们的框架内使用时,其定位准确率比作为单一评判器评判整条轨迹时高出数倍,这表明瓶颈在于评估方法而非模型能力。
