论文

ARM:使用路由内存进行可学习稀疏控制的注意力

ARM: Attention with Routed-Memory for Learnable Sparse Control

模型推理KV Cache

摘要

尽管长上下文推理取得了进步,但大型语言模型 (LLM) 仍然从根本上受到稳定计算所需的键值 (KV) 缓存机制的限制。选择性词元驱逐和修剪等技术极大地缓解了这些问题,但通常会丢弃核心信息来管理不断增长的缓存。在本文中,我们提出了路由内存注意力机制(ARM),这是一种新颖的 KV 缓存结构,它引入了一个完全可微的、固定大小的内存系统,该系统被组织为分层路由器。通过 Gumbel-Softmax,ARM 学习选择内存插槽并执行 sigmoid 门控更新,软性组合新信息和存储信息,避免硬驱逐并减少信息丢失。通过进一步训练在推理时动态选择不同内存量的策略,ARM 可以针对简单上下文和需要更深入推理的输入调整其访问,从而在短上下文和长上下文上实现更具可扩展性和更有效的检索。标准常识和长上下文推理基准测试的实验结果表明,与固定 KV 缓存方法相比,ARM 实现了卓越的性能和效率,同时在内存和生成延迟方面保持高效和可扩展。