论文
ShardMemo:分片代理 LLM记忆的屏蔽 MoE 路由
ShardMemo: Masked MoE Routing for Sharded Agentic LLM Memory
摘要
代理大语言模型(LLM)系统依赖外部内存来实现长范围状态和并发多代理执行,但随着内存量和并行访问的增长,集中式索引和启发式分区成为瓶颈。我们推出了 ShardMemo,这是一种预算分层内存服务,具有 A 层每个代理的工作状态、B 层具有分片本地近似最近邻 (ANN) 索引的分片证据,以及 C 层(版本化技能库)。 B 层强制执行路由前范围:结构化资格约束在路由或 ANN 搜索之前屏蔽不合格的分片。我们将分片探测作为对合格分片的屏蔽专家混合 (MoE) 路由,通过 Top-$B_{\mathrm{probe}}$ 或自适应 Top-$P$ 探测最多 $B_{\mathrm{probe}}$ 分片,并在配置文件/观察/会话分片系列上使用成本感知门控;路由器接受从证据到分片监督的训练。在 LoCoMo 上,ShardMemo 在各个问题类别的 F1 上比最强基线 (GAM) 提高了 +5.11 至 +6.82。在固定预算路由设置 ($B_{\mathrm{probe}}=3$) 下,ShardMemo 比余弦到原型分片路由提高了 +6.87 F1,同时减少了检索工作 (VecScan 521->414, -20.5%) 和 p95 延迟 (95->76 ms)。在长上下文 HotpotQA 上,ShardMemo 在 56K/224K/448K token下实现了 63.41/61.88/57.95 F1。在 ToolBench 上,C 级达到 0.97 Precision@3 和 1.94 StepRed(比嵌入相似性检索 +10.2% 和 +7.2%)。
