论文
DeepSeek-V4:迈向高效的百万词元上下文智能
DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence
摘要
我们推出了 DeepSeek-V4 系列的预览版,包括两个强大的 Mixture-of-Experts (MoE) 语言模型 - 具有 1.6T 参数(激活 49B)的 DeepSeek-V4-Pro 和具有 284B 参数(激活 13B)的 DeepSeek-V4-Flash - 均支持一百万个词元的上下文长度。 DeepSeek-V4系列在架构和优化方面进行了多项关键升级:(1)混合注意力架构,结合压缩稀疏注意力(CSA)和重压缩注意力(HCA),提高长上下文效率; (2) 流形约束超连接(mHC),增强传统的残差连接; (3) 和 Muon 优化器可实现更快的收敛和更高的训练稳定性。我们在超过 32T 的多样化和高质量词元上对这两个模型进行预训练,然后通过全面的 后训练 管道来解锁并进一步增强其功能。 DeepSeek-V4-Pro-Max 是 DeepSeek-V4-Pro 的最大推理工作量模式,重新定义了开放模型的最先进水平,在核心任务上优于其前辈。同时,DeepSeek-V4系列在长上下文场景下效率很高。在百万词元上下文设置下,与 DeepSeek-V3.2 相比,DeepSeek-V4-Pro 仅需要 27% 的单词元推理 FLOP 和 10% 的 KV 缓存。这使我们能够定期支持一百万个词元上下文,从而使长期任务和进一步的测试时间扩展变得更加可行。模型检查点位于 https://huggingface.co/collections/deepseek-ai/deepseek-v4。