通过在线最大成员聚类与原子感知打包实现低内存LLM智能体
Compact-Memory LLM Agents via Online Max-Member Clustering and Atom-Aware Packing
摘要
许多长期 LLM 部署都面临着紧张的提示预算:随着交互长度的增长,延迟、成本和上下文限制使得完整上下文提示变得不切实际。那么,关键问题不仅仅是原始召回,而是哪种内存设计能够提供最佳质量——紧凑内存机制中的Token权衡。我们提出了 RSM-full,一个在线集群内存管道,专为强大的质量Token帕累托点而设计。 RSM-full 结合了两种设计选择:余弦门控 max-member merge 写入规则和原子感知分组上下文打包程序。在我们主要的紧凑型内存基准 AMA-Bench 上,它以 4$k 美元的预算,以 32%$ 的Token成本达到了 83%$ 的全上下文质量;在四种子平均下,它在整个 ${\sim}2.6$k--${\sim}5$k 体系中以 $+3.5$--$6.0$,pp ($p{<}.001$) 击败了最接近的流集群基线(在线 K-Means)。三种子消融显示,大部分收益来自合并规则($+5.7$,pp 超过在线 K 均值和匹配的 $\tau$ DP 均值)和分组打包程序($+5.0$,pp 超过平面串联)。该模式在独立的长期角色记忆基准 RealMem 上重现:RSM-full 在 Budget-RAG 上进行了改进($+0.69$,pp, $p{=}.006$),与 BM25-RAG 相当(配对 $\Delta{=}{+}0.27$,pp, $p{=}.47$;我们确实not声称 BM25 在等价测试意义),并且显着优于 Streaming-Proto ($+2.97$,pp) 和最接近的复制的 2025 年智能体记忆基线 A-MEM ($+1.65$,pp, $p{<}.001$)。跨基准的信息是一致的:在预算紧张的情况下,紧凑型内存性能主要取决于流内存的合并方式以及检索内容的组装方式。总体而言,RSM-full 在回答大约 $2k$-$5k$ 提示标记时最有用,它定义了一个强大的紧凑内存帕累托点;在该制度之外,较高Token的基线仍然更强。