论文
Beyond the Model:拆解软件工程Agent的Harness效果
Beyond the Model: Demystifying Harness Effects in Software Engineering Agents
摘要
基于LLM的Agent越来越多地用于软件工程,但其表现不只由基础模型决定。Agent Harness显著塑造它们与仓库交互、执行动作和验证方案的方式。然而,Harness设计在不同模型、任务与组件间的作用仍缺充分理解。本文系统实证研究软件工程Agent的Harness效果。首先在SWE-bench Pro、ProgramBench与GitTaskBench上,以Qwen和DeepSeek两个知名开放权重家族的十个模型,评估mini-SWE-agent与OpenCode两种代表性Harness。随后在mini-SWE-agent上构建轻量模块化NanoHarness,分析工具注册表、上下文压缩、显式规划、子Agent和延迟加载技能五项组件。结果表明,Harness有效性共同取决于模型能力与任务类型。随着模型能力增强,复杂Harness在SWE式问题修复中边际收益递减,但在更复杂、开放的仓库级任务上可能帮助强模型。ProgramBench组件分析进一步发现,结构化工具使用与任务专用子Agent改善最稳定,上下文压缩和通用子Agent则可能损害仓库生成表现。组合后,NanoHarness在Qwen3.7-Max和DeepSeek-V4-Pro上分别比mini-SWE-agent提高7.37和6.21个百分点,恢复产品级Harness的大部分收益。这些发现将Harness设计强调为软件工程Agent表现的核心因素,为构建更有效、高效的编程Agent提供参考。