技术实践

Anthropic 以生成-评估分离的多智能体脚手架支撑长时自主编程

智能体系统Agent Harness智能体互操作协议Agent任务评测MCP长程任务评测

概述

Anthropic 工程团队总结长时运行应用开发场景下的 harness 设计要点,核心是受 GAN 启发的生成者-评估者多智能体结构。前端设计实验中,团队用四条评分标准把「设计好不好」转成可打分项,评估者通过 Playwright MCP 实际操作页面后再打分,每轮生成迭代 5-15 次、完整运行可达 4 小时,曾让一个艺术博物馆网站在第 10 轮自发重构为 3D 空间体验。随后扩展为规划者、生成者、评估者三智能体的全栈架构:规划者把一两句话扩展成完整产品规格,生成者按 sprint 逐个实现功能并与评估者协商验收契约,评估者用 Playwright 按硬阈值测试验收。对比实验显示,单智能体生成的复古游戏编辑器核心功能不可用,harness 版本成本高出 20 倍以上但可玩,其规格含 10 个 sprint、16 项功能,仅 Sprint 3 就有 27 条验收标准。针对长任务的「上下文焦虑」,早期版本以上下文重置加结构化交接应对;模型升级到 Opus 4.6 后团队删去 sprint 结构、评估改为收尾单次复核,数字音频工作站案例耗时约 4 小时、花费约 124 美元 token,QA 仍能揪出录音桩、剪辑拖拽等缺失。团队结论是评估者只在任务超出模型可靠独立完成的边界时才值得开销,新模型上线应重审脚手架、移除不再承重的部件。