论文

CatchBench:何时可以捕获代理故障?

CatchBench: When Can an Agent Failure Be Caught?

智能体系统Agent任务评测

摘要

什么时候可以发现代理故障?仅凭审核分数较低无法确定记录或方法是否有限制。因此,CatchBench 将审核员的问题提出到三个信息状态:运行前声明的配置 (PRE)、其跟踪的增长前缀 (LIVE) 以及完成的跟踪 (POST)。先前的基准测试修复了这些状态之一或改变了遥测;据我们所知,没有人能够在同一个任务方法界面下对这三项进行评分。每个州都会承认不同的问题,因此七个任务合同都有自己的标签和指标,而不是一个排行榜。四是证据;三是金衍生机制诊断。该版本对 72 名参赛者进行了评分,从规则扫描仪和结构模型到 9 个模型系列(GPT、Claude、Gemini、Gemma、Llama、Qwen、DeepSeek、Mistral、Nova)的 11 名 LLM 评委,超过 1187 种声明的配置和 1162 次记录的运行。每一个记录的比较都会作为其间隔的测量差异发布,未经修正,并且没有董事会宣布其无法显示的获胜者。三个最明显的结果与我们自己的数据相悖。一条规则仅读取声明顺序,并在六个配置源之一上达到完美的 F1,因此那里的分数衡量语料库的构建方式。然后,我们的受理律师拒绝了一份注入的底物,并隐瞒了另一份的证据状态。已发布的结构增益还取决于其衡量的尺寸参考。因此,在发布其标签背后的过程并对其可能留下的捷径进行测试之前,基准数字是不可解释的。我们报告所有三个,并从发布的预测中重新生成每个订单,而无需模型调用。