Harness工程:编码智能体 的剖析、架构和演变——十一个系统的源代码研究
Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents -- A Source-Code Study of Eleven Systems
摘要
代理是一个模型加上一个工具——通过循环、工具、上下文管理、安全控制、编排和扩展表面将 LLM 连接到世界的运行时。Harness工程于 2026 年初被命名为一门学科,是该运行时的设计和演变。本文为这一新兴学科提供了迄今为止最全面的实证基础:对 11 种生产编码工具(Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw)的源代码剖析,以及作为对比点进行分析的第一个元工具 Omnigent。我们定义了harness是什么,映射了它的七个规范子系统以及每个子系统的最小和最大实现,并沿着这些子系统剖析了所有十一个系统。审计产生了 13 条交叉观察结果和 29 种重复设计模式的目录。在语料库扩展了三倍之后,仍然存在两个缺失:在大约 400 万行 Python、TypeScript 和 Rust 中,没有代理运行时导入通用代理框架,也没有代理运行时使用向量嵌入来检索代码;该领域在手动异步循环和确定性检索上运行。 SKILL.md 技能在 MCP 的采用方面处于领先地位(9/11 与 8/11),ACP 在六个系统中提供,并具有新的第三个角色:Harness托管。由于原来的八个系统是重新固定而不是替换的,因此该研究还包含一个受控的纵向样本——同样的利用源在四分之一内有所不同——显示趋同变成了模仿,行为政策从即时散文迁移到配置。这些线索集中在本文的主题上:2026 年上半年,编码工具完成了从工具到平台的转变。该论文最后提出了 18 条设计建议和 90 行最小可行Harness支架。