论文
编程Agent的Harness设计:规划、工具与上下文管理的实证比较
An Empirical Study of Harness Design for Coding Agents
摘要
编程Harness影响自主编程智能体如何将模型能力转化为长程软件工程表现,但现有工作通常把Harness作为整体系统评价,难以明确单个组件的效果。为实现组件级对比,我们使用一种轻量编程Harness,固定执行循环,仅改变规划、动作空间和上下文管理三个组件。在SWE-Bench Verified与Terminal-Bench 2.1上评估四个模型,测试176组配对设置,覆盖五种上下文管理策略、四种上下文窗口预算,以及针对规划和动作空间的消融。我们发现:(1)上下文预算越紧,管理上下文越有价值,其大部分收益来自避免上下文溢出失败。(2)先进行规则式删减、再采用LLM摘要,在所比较上下文管理策略中具有最强的总体效率;使被删内容能够恢复,则增加了模型很少使用的机制,并未带来准确率提升。(3)对较弱模型,规划主要支持准确性;对较强模型,它转而节约成本,准确率变化较小。(4)预定义工具能改善bash能力较弱模型的表现,而擅长bash的模型能够仅使用bash接口有效工作,并显著降低成本,在命令行任务中尤其明显。轨迹级分析解释了这些效应:上下文管理延长执行轨迹,但没有显著改变智能体行为;规划改变轨迹停止的位置;动作空间改变代码编写的粒度。这些发现支持根据模型和预算设计Harness,并提供评估未来Harness组件的模块化框架。
