技术实践
腾讯以工作流规则治理Harness的Token成本
概述
该团队近半年用 AI Agent 驱动前后端协同开发,全流程由 tech-leader 这个 harness Skill 统一调度(TL 调度层 + Wave 1 前后端并行 Agent + Wave 2 质量审查 + Wave 3 测试 + Wave 4 视觉验证 + Wave 5 评测),一个中等需求需 5-6 个 Wave、20+ 次子 Agent 调用、数百轮工具调用。 团队先用 CodeBuddy 内网版上报至内网 AgentLens 平台的 token 数据(agentlens-mcp 可按 TraceId 追踪单次调用链路、按 SessionId 聚合完整需求消耗)做度量,定位到系统提示词、工具返回信息、历史消息等六类消耗来源,再围绕三原则落地十项改造,并先做 S/M/L 规模预判决定是否拆多 Agent。 实测:TAPD/Figma 调用子 Agent 化只回结构化摘要后,单轮会话 input token 从 1,030,000 降到 634,905(-38.4%)。用 graphify 代码图谱(AST + 语义建立文件索引与依赖关系)替代关键词盲搜后,相同任务总 token 从 87.5 万降到 67.7 万(-22.7%,节省约 19.8 万),输入 token -22.8%。 把自动化测试、视觉还原对比等规则性强、轮次多的角色换成 GLM-5v(成本约 Sonnet 的 36%)后,测试/视觉 Agent 成本 -64%。自动化测试 Skill 正文从 198 行降到 128 行(-35%)。按 Wave 消耗分布代入各分项已验证降幅反推,中型需求全流程 token 成本大致降低 50%~65%。