阿里内部诊断Agent团队在百炼qwen3.7-max上实施Harness成本优化
概述
阿里巴巴内部用于故障诊断、成本分析的Agent(钉钉诊断任务自7月起大规模接入)跑一个模糊需求要展开30至40轮、消耗几十M token,费用压力突出。作者景钊所在的团队在百炼qwen3.7-max生产链路上开展Harness成本优化,先以自研usage采集、自建Langfuse和自建评测Agent三条链路交叉度量,在6月与7月质量总分基本持平的前提下逐步落地,8月完整上线。优化沿几条线展开:少发——删除约1.2K token的ReACT教学文本且观测工具调用准确率无下降,System Prompt每轮重建不写入历史,因百炼静默忽略defer_loading与tool_search字段而在Harness层自建延迟工具加载(低频工具schema移出每轮请求、目录不超50行),Skills全文只注入一次、重复Read按mtime去重,并把MCP能力迁往CLI加Skills(此前24个Mongo工具每轮有两三千token固定开销);发得便宜——System Prompt按Constant、SessionStable、MidConversation与动态区分层,在请求尾部标记cache_control断点,2026年7月26日同场景对比中显式缓存加权命中0.898、最低0.640,隐式缓存加权0.800但出现两次全量脱靶,隐式缓存命中率也从33%提升到80%;少想——辅助调用关闭thinking,主Agent设4096的thinking_budget上限;隔离与拦截——Subagent只回传不超过600字符摘要,四类空转Hook拦截重复与无效轮次,ModelRegistry按角色分流模型(K8s Agent四角色全用Flash,单次诊断费用约为原来的1/15)。按20轮会话、只计主Agent输入侧测算,输入费用由9.84元降至1.16元,降幅88.2%,该数字假设20轮均在5分钟缓存有效期内连续命中,叠加输出侧与其他优化收益会更高。