论文

智能体AI系统中的资源约束与性能

Resource Constraints and Performance in Agentic AI Systems

智能体系统Agent任务评测

摘要

更加自主的人工智能的进步越来越依赖于将语言模型与工具、内存、状态管理和多步骤执行相结合的代理系统。这些机制决定了任务能力和操作负担。我们使用配对的主要基准和更详细的配对提示子集将 OpenClaw 和 NanoBot 作为完整的代理系统进行比较。在主要基准测试中,OpenClaw 的完整任务完成率为 31%,NanoBot 为 25%,相差 6 个百分点,95% 的任务引导间隔在 -3 个百分点到 15 个百分点之间,这两个系统都没有提供统计上确定的完全完成优势。在仪表层,两个系统都实现了 26% 的完全完成,而 NanoBot 在 43% 的提示上至少部分完成,而 OpenClaw 为 26%。 OpenClaw 在 83% 的提示上花费了更长的时间,并且在每个提示上记录了更高的峰值记忆值,墙上时间的几何平均比率为 2.98,峰值记忆的几何平均比率为 19.44。在至少有一个系统部分或全部完成的十个详细层提示中,NanoBot 在八个上微弱地占据主导地位;然而,在所有 23 个提示中,其 18 个优势案例中有 10 个是成本较低的联合失败。两个证据层的结果标签有所不同,这表明为什么代理系统评估应该将能力和资源测量与尝试级执行和评分来源联系起来。这些发现表明,应该通过验证任务完成情况、观察资源使用情况以及将每个结果与产生该结果的执行相关联的记录来评估更加自主的人工智能的进展。

智能体AI系统中的资源约束与性能:论文配图
图1:Paidad 失败、部分和通过100速率基准的过渡。每个单元格都给出一个即时的计数及其在全部基准中所占的份额。对角单元格代表48个附带结果。