论文

多 Agent 持久记忆的成本、收益与可识别条件

Persistent Memory in Multi-Agent LLM Inference: What It Costs, What It Buys, and When You Can Tell

模型评测评测方法与指标

摘要

跨协作智能体分解长上下文推理会限制每次调用的活动 KV 缓存,而不是总证据,这在 KV 缓存内存绑定时很重要。许多此类系统添加了一个持久层来存储和调用推理轨迹,通常由报告准确性增益的 消融 进行验证。我们在一个三层智能体架构上对两者进行测量。分解提供:每个查询的峰值 KV 工作集为 14.3 MiB,而单遍和检索增强基线为 35.5 和 35.3 MiB。持久层则不然:在每臂 n=100 的八个受控数据集对中,它消耗了 +0.368 MiB [+0.167, +0.590] 的峰值缓存,并且不会产生可检测到的精度变化(+0.015,95% CI [-0.011, +0.046])。我们认为零是结构性的:单问题基准为每个项目提供自己的证据并对其进行独立评分,而正确性需要重置条件之间存储的跟踪,因此 召回率 没有任何信息可供检索。达到这个目标需要四次测量修正——其中三次夸大了明显的好处,第四次使尺寸看起来可以解析——在结果表中看不到任何结果。我们给出了智能体-记忆消融 必须满足的条件和不需要了解特定缺陷的检测程序。

多 Agent 持久记忆的成本、收益与可识别条件:论文原图
图1:被测系统与消融单轴变化;附录 A.1 给出了块级调用序列。