论文

没有任务每次都会失败:为什么一次性审核在结构上对代理损坏视而不见

No Task Fails Every Time: Why One-Shot Audits Are Structurally Blind to Agent Damage

智能体系统Agent任务评测

摘要

我们引入了 AgentRelBench,这是一种与环境无关的可靠性工具,可计算 真值,即重复运行期间数据库状态差异的严重性代价损坏,测量路径中没有 LLM,这在 EnterpriseOps-Gym 上进行了演示。在跨越 6 个系列的 9 个模型(四个开发模型、三个预注册保留模型,加上预注册指定为探索性的两个前沿模型的前沿通行证)的 2,128 次评估运行中,我们发现:(1)不可逆转操作的损害在我们测量的所有系列中是普遍存在的,并且在固定的单一提供商堆栈上是随机的。 (2) 每次运行都不会损坏任务:在 42 个确认性保留损坏事件中始终失败的单元为零。单次干净运行在开发池(13 对)上错过了 0.80 个产生损害的(模型、任务)对;保留池在描述上是一致的(5 对以上为 0.575,对加权),但位于我们预先注册的功率底线之下,并且被报告为功率不足,而不是作为确认。 (3) 产生损害的任务数量随着模型能力的增加而下降,从 8B 模型的 20 个任务中的 7 个到最有能力的模型的 20 个任务中的 1 个;能力与家庭和训练相混淆,因此这是一个观察到的梯度,而不是因果关系。残余损坏的性质没有改变:在探索性前沿通道中,最有能力的模型的一个破坏性任务每次运行的损坏为 $\hat{p} = 0.16$,在相同的可证明随机范围内,并且单次审计在 84% 的情况下会错过它。 (4) 一个模范家庭在宣布拒绝的同时,做出了门控的不可逆转的改变:基于成绩单和法官的评分将这些跑步评分为安全拒绝,仅将差异列为损害。所有确认结果均按照每个索赔降级标准进行预先注册;其中一个降低了我们最初喜欢的发现,我们对此进行了报道。