论文

智能体总成本:多Agent LLM工作流中记忆注入成本的精确归因

Total Cost of Agency: Exact Attribution of Memory Injection Cost in Multi-Agent LLM Workflows

AI 基础设施上下文与知识智能体系统记忆Agent Harness可观测性Agent记忆

摘要

多智能体大语言模型(LLM)工作流中的每个节点都会从记忆中检索上下文并注入其提示词,这些注入的 token 以与系统提示和用户查询相同的单价计为输入 token。生产可观测性工具只报告总 token 成本,不区分节点自己生成的 token 与交给它的 token,因此这部分账单对付费团队不可见。我们提出智能体总成本(TCA),将多智能体工作流成本分解为基线提示、推理、记忆注入、未命中惩罚和上下文累积等组成部分,以及一种精确归因方法:两遍、不计费的 token 计数,直接测量注入 token 而非用字数代理来估计。在针对真实模型 API 执行的 200 任务企业基准上,记忆注入占编译期优化器可作用的可变成本的 13.6%,约占全部计费成本的 12%,其份额从工作流深度为一时的结构性零上升到深度六时的 27.6%。在测量的深度范围内(深度 2 至 6,R^2 = 0.9974),注入 token 随深度线性增长;二次拟合的首项系数为负,因此数据在这些深度上不呈凸性增长。我们表明该成分在固定模型档位下是可控的:将检索窗口容量从 32 条降至 2 条,注入 token 减少 28.7%,而准确率变化在种子级波动范围内。我们完整报告:图重写变换单独看近似成本中性;五个分解项中有两个在该测试环境中按构造为零;总工作流成本由模型档位分配主导,我们将其固定并视为既有工作。未评估提示缓存;所有数字均针对未缓存情形。

智能体总成本:多Agent LLM工作流中记忆注入成本的精确归因:论文配图
图 2:注入行为随工作流深度的变化。上:每任务注入 token 数,并对深度 2 到 6 做线性拟合;深度 1 的点是结构性零点(源节点没有可注入的上游输出),不参与回归。对相同点做二次拟合得到负的 leading 系数。下:在两个层级上注入占计费成本的比例;两条曲线几乎重合,因为两个层级共享相同的输入/输出价格比。