FlashMemory-DeepSeek-V4:通过 Lookahead Sparse Attention 实现闪电索引超长上下文
FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention
摘要
传统的 LLM 在解码过程中保持加载完整的 KV 缓存,导致超长上下文服务出现严重的 GPU 内存瓶颈。在本报告中,我们提出了 \textbf{Lookahead Sparse Attention (LSA)},这是一种新颖的推理范例,由基于 DeepSeek-V4 架构构建的神经内存索引器提供支持。 LSA 不是被动地处理所有历史标记,而是主动预测未来的上下文需求,并仅在 GPU 内存中保留查询关键的 KV 块。至关重要的是,我们通过 \textbf{backbone-free 解耦训练}策略实例化该架构。通过将索引器制定为标准双编码器架构,我们使用标准检索训练框架对其进行独立训练,而无需将大量骨干模型加载到 GPU 内存中。我们证明,这种“少即是多”范式可以显着最大化服务效率,同时在依赖长期全局记忆的任务中充当有效的注意力降噪器。在主要的长上下文评估套件(例如,LongBench-v2、LongMemEval 和 RULER)中,\texttt{FM-DS-V4} 将平均物理 KV 缓存占用空间压缩至仅全上下文基线的 13.5\%,同时始终保持或略微提高下游精度(平均+0.6\% 绝对裕度)。在 1M 上下文中,每个解码令牌计算量下降至基线的 0.30$\times$,GPU KV 缓存缩小了 90\%(3.73$\to$0.37 GB),在 8$\times$H20 GPU 上的 PD 分解服务中转化为 \textbf{2.8$\times$ 聚合吞吐量和 2.7$\times$ 并发增益}。