论文
UndoBench:分开评估工具型AI智能体的任务能力与故障恢复能力
UndoBench: Separating Task Competence from Recovery Capability in Tool-Using AI Agents
摘要
工具型AI智能体越来越多地部署于企业软件系统,但常用基准主要评估正常条件下的任务完成,混合了基础规划能力和运行故障恢复能力。我们提出UndoBench,覆盖8个企业领域的36个基础工作流和36种故障场景。它在相同随机种子下开展反事实配对试验,并结合通信层面的效果历史和环境状态参考判定器,将任务能力与恢复能力分开。在冻结的“确认信息丢失”研究中,我们针对12个留出的TEST工作流,比较两个开放权重模型、两个框架和三种恢复范式,共执行5,760次,形成2,880组配对试验。正常任务成功率达到83.54%,条件恢复成功率(CRSR)却降至46.72%;朴素重试在53.33%的试验中产生重复的外部效果。扩展到商业API模型的实验也重现了任务能力与恢复能力的分离。针对互补执行边界的评估表明,恢复能力依赖执行阶段:状态变更之前,各方法表现相近,具备正常完成能力的试验中没有重复效果;部分状态变更期间,朴素重试、逐调用幂等和零特权日志在所评估的复合工作流上均失效;提交完成但确认尚未返回时,验证与服务端幂等显著改善安全性。这些发现表明,只评估正常完成情况会掩盖自主智能体关键且依赖阶段的恢复漏洞。
