DeepSeek-V4.1-Flash:突破 KV 缓存压缩的极限
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
摘要
长视野智能体的广泛采用使得模型工作负载的输入量越来越大。尽管之前的工作已经大幅降低了长上下文计算的成本,但预填充的计算成本仍然很高,而且大型 KV 缓存继续对 HBM 和 SSD 容量以及数据传输带宽造成压力。这些计算、存储和带宽需求共同构成了进一步降低部署成本的主要瓶颈。为了应对这一挑战,我们引入了 DeepSeek-V4.1-Flash,这是一种多模式专家混合 (MoE) 模型,具有 552B 主干参数并支持多达 100 万个词元的上下文。凭借其因果编码器-解码器 (CED) 架构,该模型在解码期间为每个词元激活 16B 个参数,但在预填充期间仅激活 8B 个参数,从而大大提高了代理工作负载的成本效率。为了突破 KV 缓存压缩的限制,DeepSeek-V4.1-Flash 将压缩稀疏注意力 2 (CSA2) 中的跨层 KV 缓存重用与 FP4 KV 缓存相结合。这些设计将其全局 KV 缓存占用空间(始终以 HBM 形式)减少到每个词元 890 字节,大约是 DeepSeek-V4-Flash 相应占用空间的 1/4。此外,通过称为 SWA Bounded Replay 的专用部署优化,DeepSeek-V4.1-Flash 将其持久 KV 缓存占用空间(始终在 SSD 上或主机内存中)减少到 DeepSeek-V4-Flash 的大约 1/8。尽管 KV 缓存占用空间小得多,但该模型提供了比基准更好的性能。此外,我们还简化了 DeepSeek-V4 架构,并引入了多种高效的架构扩展。我们在包含 45T token 的多模态语料库上对 DeepSeek-V4.1-Flash 进行预训练,并进行全面的后训练,在不同的基于文本和多模态代理场景中产生了强大的性能。模型检查点位于 https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash。