论文
多头循环记忆代理
Multi-Head Recurrent Memory Agents
摘要
循环内存代理通过迭代地将输入合并到固定大小的内存窗口中,将 LLM 扩展到任意长的上下文。尽管具有可扩展性,但这些代理表现出一个有据可查的可靠性问题:随着上下文长度的增长,端到端性能会系统性地下降。我们通过将性能分解为两个因素(内存捕获和内存保留)来诊断此故障,并定量地确认保留是主要瓶颈。保留崩溃是因为现有设计将内存维持为整体文本块,迫使每次更新都有覆盖以前保留的内容的风险。受此诊断的启发,我们提出了多头循环存储器(MHM),这是一种通用的 无需训练 框架,它将内存划分为由分阶段选择然后更新策略控制的独立头。在每一步中,都会选择一个头进行更新,而其余头在结构上不会被覆盖,从而将保留的负担从模型行为转移到架构设计。作为轻量级实例,我们引入了最近最少更新的 MHM (MHM-LRU),它保证了统一的磁头利用率,且附加词元开销为零。对长上下文基准的大量实验表明,MHM-LRU 极大地提高了 100K--1M 词元范围内的保留率和端到端准确性,而该范围内基线急剧下降。在 896K 词元的 RULER-HQA 上,MHM-LRU 将内存保留率从不到 30% 提高到 73.96%。这些收益适用于模型系列、规模和任务类型,将架构优化定位为实现可靠的长上下文循环记忆的实用且经济高效的路径。