论文

Who&When Pro:LLM真能为AI智能体的失败归因吗

Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?

智能体系统Agent任务评测

摘要

自动化失败归因用LLM识别智能体系统在哪里、为何失败。随着智能体能力增强,其失败愈发隐蔽,自动化归因愈发重要。我们提出Who&When Pro:一个面向智能体系统自动化失败归因的大规模基准。使用严格受控的管线——仅在精确重放成功前缀之后注入失败——我们构建了12,326条带金标标签的失败轨迹,横跨3种模态与26个基准、覆盖多样场景。除基准测试外,我们开展大量实验与分析:揭示模型跨模态、协议与模型家族进行失败归因的系统性规律,并为未来自动化失败归因系统提供经验指导。

Who&When Pro:LLM真能为AI智能体的失败归因吗:论文配图
图 1:Who&When Pro 概述。内环将 26 个源基准分为 9 个任务类别。外环将每个基准映射到其模式(文本、图像、视频)。四个角面板展示了跨模式和代理拓扑的故障归因示例。 (左上)视频代理错误识别了帧。 (右上)多代理编码管道采用次优架构。 (左下)图像 QA 代理误读了图表趋势。 (右下)网络代理偏离了用户任务。每个面板中都突出显示了决定性的失败步骤。跟踪内容是出于说明目的而总结的,并不反映完整的代理输出。