论文

Harness能买什么? token,大部分

What Does a Harness Buy? Tokens, Mostly

智能体系统Agent任务评测

摘要

编码智能体是封装在Harness中的语言模型:系统提示、工具集和上下文管理,将聊天模型转变为可以在存储库中工作的东西。生产版Harness每天发布,供应商宣传Harness更改带来的通过率增益,排行榜自由混合Harness。很少测量的是当模型保持固定时,Harness本身使分数移动了多少。我们在 SWE-bench Verified 上通过三个生产Harness、Claude Code、mini-SWE-智能体和 OpenCode 运行五个模型,并重新运行相同的配置来校准当除了运行之外没有任何变化时分数移动的程度。在 447 项任务和我们在那里跑的两个模型上,Claude Code 和 mini-SWE-智能体,最重和最轻的Harness,在 5 分之内相当。在 45 个任务的硬子集和 5 个模型上,交换Harness翻转的任务数量与重新运行相同的Harness翻转的任务数量相同,两种情况均为 13%,并且Harness在一次运行中赢得的任务并不是它在下一次运行中赢得的任务。消除噪音的Harness效果是一种损失,而不是一种增益:OpenCode 在大池中落后了多达 9 个点,而在一个模型上,该差距的一半位于其输出上限缩短的运行中。 Harness所做的决定是账单。对于相同的型号、相同的任务和一份价目表,Harness中每项任务的成本最多相差 3 倍。间隙是在第一次调用时通过每个Harness每一步发送的系统提示和工具模式的前导码设置的,并按步数缩放;每步增长和每次调用工具输出的差异要小得多。提供商对缓存输入的价格按比例调整账单,并且不会重新排序。重新运行的数据还给出了Harness比较需要的分辨率:在我们观察到的不一致情况下,45 个任务仅在一半的时间内捕获了 13 点的差距,并且在 80% 的功率下没有差距,而 447 个任务解决了 5 点,仍然比许多Harness更改声称的增益要粗糙。

Harness能买什么? token,大部分的原论文方法或结果图
图 A1:hard45,逐个任务。每个单元的规范运行。八项任务由任何一只手臂完成,四项任务由每只手臂完成。