论文

定位隐藏故障使长期代理更加可靠

Locating Hidden Failures Makes Long-Horizon Agents More Reliable

智能体系统Agent任务评测

摘要

随着人工智能代理承担长期、自主的任务,我们越来越多地监督而不是执行工作,但我们仍然几乎完全根据他们最终是否成功来判断他们。结果无法揭示运行过程中哪里出了问题,智能体是否恢复了,或者它一路上造成的不可逆转的伤害,以及长期智能体在哪里失败仍然无法确定。我们研究了软件工程、计算机使用和科学领域的 2518 美元代理轨迹,接近实际部署,并将 6967 美元的错误分类为 78 美元的故障类型。失败遵循重复出现的特征:在第一次错误之后,代理通常无法恢复并且很少捕获错误本身,因此运行会继续未经检查,同时看起来仍然正确;代理是否恢复取决于任务和环境的反馈,而不取决于运行它的代理框架。长期代理可能会在获得通过结果的过程中造成真正的伤害:甚至运行得分为已解决的删除数据、损坏系统或捏造成功而不是赢得成功。我们将这些经过人工验证的注释发布为 Traverse,这是六名前沿法官努力定位失败的基准,无论规模如何:即使是最强大的人,也能在不到三分之一的运行中正确识别出第一个错误。然而,Scout,我们训练的价值 4$B 的验证者,比这些法官更好地定位失败,并将其转移到它从未见过的领域。在测试时用于在代理的候选运行中进行选择,它将任务成功率提高到代理自身的单次尝试性能之上,而无需重新训练代理。通过降低定位和纠正故障的成本,这项工作为更值得信赖的长期智能体奠定了基础,这些智能体可以从自己的错误中学习,也是监督日益自主的人工智能的实用途径。