治控效应:编排设计如何设定企业智能体AI的token经济学
The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
摘要
今天的智能体AI开发靠token堆能力——更长的推理轨迹、更多轮次、更宽的工具载荷、更大的重放上下文——每任务token增长快于任务价值。下降的token单价掩盖了模式;总支出照样上升。我们论证对抗token堆砌的决定性杠杆是治控:组装上下文、暴露工具、排序轮次、委派工作、承载企业可观测与治理的编排层。我们以受控交换隔离它:22个锁定评估任务、六个基础模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6),只换编排层——冻结的传统生产循环对Writer Agent Harness。保持模型不变:治控把每任务混合成本削减41%(0.21→0.12美元)、中位墙钟44%(48秒→27秒)、每任务token 38%(14.2k→8.8k),任务完成质量持平(0.78→0.81,该样本量下属方向性)。效率是模型不变的——每个模型都更便宜(33–61%)——而质量增益能力依赖:模型增益与其基线强度几乎完全相关(r=0.99,n=6)——我们称之为治控杠杆。每美元质量升82%;每百万token任务完成从54.9升至92.0。在此负载上,编排层对每任务成本的移动超过了整个模型菜单的全距。我们形式化编排层的token经济学(含提示缓存下的有效输入价格)、详述效应背后的六个机制族——从缓存形状纪律到失败支出治理——在同一轴上比较六个广泛使用的智能体系统,并论证治控是唯一其效率在企业运行的每个模型(现在与未来)上相乘的组件。