编码智能体中的脚手架效应:Harness 选择作为编码智能体评估中的隐藏变量
The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation
摘要
面向编码智能体的公开排行榜通常按模型名称和通过率对系统排名,而周围的 harness(负责发起工具调用、管理上下文并决定何时停止的脚手架)往往未被充分说明。当 harness 固定时,模型间比较是有效的;当 harness 变化时,性能和效率便混淆了模型与脚手架两方面的效应。我们在 Terminal-Bench Pro 的分层50个任务子集上,跨三个开源 harness(Goose、OpenCode、OpenHands-SDK)评估了 Qwen 3.6 Plus 和 MiniMax M2.5。Harness 选择在每个解题任务消耗的 token 数上造成高达40倍的差异,而同模型配对的通过率差异仍保持在0-8个百分点(95%配对任务自助法置信区间除最大差距外均包含零)。失败指纹在不同模型间可复现(Goose 的 REASON、OpenHands-SDK 的 VERIFY/MAX_TURNS、OpenCode 的 idle-loop/TIME),表明 harness 层面的偏差在很大程度上与模型无关。对于以人为中心的编码智能体评估而言,仅凭模型名称是不完整的比较单元:harness-模型对决定了真实世界的成本、延迟和监督负担;无动作回合是按任务计的等待税,而不仅仅是 token 税。因此我们建议在 token/延迟预算下按通过率选择 harness-模型对,并在任何模型比较中同时报告 token 用量、延迟和完整的 harness 规格。我们发布了匿名化配置、原始试验日志、聚合快照和分析脚本。