Harness还是模型?用受污染控制的私有测试隔离编程Harness效应
Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite
摘要
智能体编程系统将语言模型与Harness结合:工具、提示词和控制流程把聊天模型变成自主软件工程师。厂商会提供针对自家模型调优的Harness,实践者通常认为原生搭配能解决更多任务。我们在一个包含256个代码仓库任务和模型知识截止后竞赛任务的私有、受污染控制的测试集上,以相同模型的配对对比检验这一假设。同样的80个任务分别在claude-opus-4-8上的claude-agent-sdk与deepagents,以及gpt-5.5上的openai-codex SDK与deepagents中运行,gemini-3.5-flash和deepseek-v3.2作为旁侧实验组。800次计划运行中,792次由隔离的判定程序评分。两组对比都未能确定任一Harness具有平均优势:Opus 4.8为−1.25个百分点(48.8%对50.0%,按任务自助采样的95%置信区间为[−10.0,+7.5]),GPT-5.5为+1.25个百分点(55.6%对54.4%,置信区间为[−4.4,+6.9])。Opus的平均值混合了方向相反的分层结果:原生Harness在61个仓库任务上落后9.0个百分点,在19个竞赛任务上领先23.7个百分点(标签置换p=0.003)。这一划分是在查看数据后选择的,需要预先设计的复现实验。正确性与完成状态也不同:81次因达到墙钟时间上限而取消的运行中,22次已产生通过测试的补丁。根据逐轮原始用量、按固定公开价格重新计价,中性Harness每个已解决任务的成本在Opus 4.8上为原生的1.3—1.6倍,在GPT-5.5上为1.2倍。这些是基于观测用量的估计。Anthropic账户中58次运行没有用量记录,将这些支出分配给任一实验组会使Opus比值落在0.7—2.3之间,因此实际账单的高低排序尚不能确定。本修订纠正了2026年8月手稿:此前成本数字依赖于我们自身遥测中的用量语义缺陷(第5.1节)。我们公开编排器、评分程序、重新分析代码和派生汇总,任务仍保持私有。