论文
Who&When Pro:LLM真能为AI智能体的失败归因吗
Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?
摘要
自动化失败归因用LLM识别智能体系统在哪里、为何失败。随着智能体能力增强,其失败愈发隐蔽,自动化归因愈发重要。我们提出Who&When Pro:一个面向智能体系统自动化失败归因的大规模基准。使用严格受控的管线——仅在精确重放成功前缀之后注入失败——我们构建了12,326条带金标标签的失败轨迹,横跨3种模态与26个基准、覆盖多样场景。除基准测试外,我们开展大量实验与分析:揭示模型跨模态、协议与模型家族进行失败归因的系统性规律,并为未来自动化失败归因系统提供经验指导。
