论文

同一模型,不同Harness:不同的编码智能体结果

Same Model, Different Harness: Different Coding-Agent Results

智能体系统Agent Harness

摘要

编码智能体由模型加harness(运行框架)组成,后者决定模型看到什么、可以使用哪些工具以及工作如何继续。我们探究当模型与任务保持不变时,更换harness是否会改变结果。我们在三个编码基准上比较了同一harness的两种配置。对照组按时间顺序提供完整对话,而处理组保留相同记录,但随着上下文填充机械地缩短较早的工具结果,并对重复或停滞的工作做出响应。在紧凑上下文下,处理组在全部三次压力对比中都提高了平均每任务fail-to-pass比例(F2PF),并在SWE-bench Verified和SWE-bench Pro上增加了完整解决方案数。紧凑窗口的Verified对比使用169个任务、20,480 token窗口和固定的480秒尝试截止时间;在该队列上,处理组将平均每任务F2PF从28%提高到49%,完整解决方案从43个增加到72个。在无需针对模型专门调优的情况下,同一冻结的处理配置也为另外三个设计不同的模型在该队列上提高了这两项指标。在宽窗口的Qwen3.6对比中,两臂在Verified和Pro上的观测结果接近,而FeatureBench在处理配置下保持更高的平均每任务F2PF。在宽窗口Verified队列上,处理配置还使每轮提示token消耗更少。由于更换harness改变了未变模型权重所能完成的任务,编码智能体评估应将模型与harness共同视为被测求解器。