技术实践

腾讯研发团队以十项上下文优化压缩tech-leader多Agent工作流成本

应用与实践上下文与知识智能体系统上下文工程记忆Agent HarnessAgent Skills编程Agent记忆

概述

腾讯技术工程作者lemonye所在的研发团队过去半年探索用AI Agent驱动前后端协同开发,由名为tech-leader的harness Skill统一调度,工作流由1个调度层加6个子Agent组成,一个中等需求要经历5至6个Wave、20多次子Agent调用和数百轮工具调用,token成本快速攀升且消耗去向不明,成为专项优化的直接动因。团队先用CodeBuddy内网版上报的AgentLens平台按调用链拆解消耗,确认系统提示词、工具返回与历史消息是大头,再沿只加载需要的、减少无关的、减少重复的三原则实施十项改造:SKILL.md条件内容与步骤细节外移到资源层,自动化测试Skill正文从198行减至128行;确定性操作交给环境脚本执行,Playwright由MCP换成CLI批量跑用例;TAPD与Figma数据获取拆给专属子Agent,单轮input token从103万降到63.5万;长期记忆先查INDEX.md索引再取正文;按角色拆分子Agent并配置工具白名单与模型分层,测试与视觉Agent换用GLM-5v后成本降64%;用graphify代码图谱替代关键词盲搜,同任务总token降22.7%;另有状态外化稳定前缀、避免下游Agent重复加载Skill、接入rtk压缩命令行输出、无依赖调用并行化。实测主Agent端到端token由708783(17轮)降至315266(9轮),降幅55.5%,轮次减少47%;子Agent单轮固定开销减少约2万token。全流程降本50%至65%是以分项数据反推的估算,严格的端到端A/B复核尚未完成;该方法依赖相应IDE与度量平台支撑,目前已在tech-leader工作流全面落地,团队计划沉淀为checklist推广到其他多Agent工作流。