论文

相同的获胜者,不同的成功率:评估 LLM Agent如何从失败中恢复

Same Winners, Different Success Rates: Evaluating How LLM Agents Recover from Failures

模型评测智能体系统Agent Harness评测方法与指标

摘要

评估 LLM Agent如何从任务中期故障中恢复对于部署可靠的 agentic 系统至关重要。现有的基于检查点的基准通过比较独立运行中选择的最佳操作来衡量恢复情况,这一量称为设定协议。然而,设定一致只是一种纯粹的顺序衡量标准,它记录哪个行动获胜,而不反映表现的绝对水平。当所有行动失败时,它们的奖励为零,并且独立运行以高概率产生相同的并列集,从而产生了一种稳定的错觉,掩盖了接近于零的恢复成功。我们通过集合路径对称结果形式化了这一限制,证明对于等成本伯努利动作,成功概率 (0.9, 0.8) 和 (0.2, 0.1) 在每个样本大小下都会产生相同的最佳动作集分布。仅仅根据哪种行动获胜的程序无法区分这两种制度。我们进一步证明,在有限时间内证明确切的人口联系是不可能的,并且将结果分配给检查点所携带的信息超出了边际结果分布。合并的成功概率是解决序数歧义的缺失标量。对 864 个冻结的 RecoveryBench 事件和两个计划队列(总共 3,456 个响应)的实验证实了理论预测。协议和坚持的质量可以朝相反的方向发展,并且改变检查点到操作的绑定会改变 8% 到 13% 的细胞水平结论。基于这些发现,我们建议报告四个诊断量(一致、全零分数、保留成功和汇总成功),这些诊断量无需额外收集数据即可暴露这种故障模式。