论文
RedKnot-MLA:用于 DeepSeek-V4 长上下文服务的多头离线在线重用
RedKnot-MLA: Multi-Head Offline-Online Reuse for DeepSeek-V4 Long-Context Serving
摘要
多头潜在注意力(MLA)通过一个打包的潜在 KV 流公开许多逻辑查询头。这种表示形式具有内存效率,但它消除了传统的头方式重用所假定的物理每头缓存边界。我们展示了我们的系统,即 RedKnot 头部感知重用原理的 DeepSeek-V4 实现。每个不可变文档在规范位置零处离线处理;经认证的当地负责人捐款将作为 MLA-Off 保留。在服务时,查询端 RoPE 重定位会恢复文档的请求位置,一个小的全局头集和受保护的本地Token行将重新计算为 MLA-Online,并且在单个共享输出投影之前合并两个路径。打包的 MLA 潜伏永远不会被分割。 DeepSeek-V4-Flash使用37个可重用层和56/8本地/全局分区,提供75.29%的分析逻辑头行上限; Pro-0813型材使用55层和112/16头,给出78.89%。 Frozen Flash 操作点显示热工件 TTFT 加速为 2.02-3.84 倍。在 256K 时,已归档的三个数据集研究报告称,F1 总变化为+3.24 个百分点,EM 变化为+4.16 个百分点,分析主要算子算术节省了 78.7-79.5%,而一个数据集减少了 2.81 个 F1 点。作者单独报告的 256K 热工件 QPS 测量结果约为 2.0 倍;由于其原始并发跟踪不包含在该捆绑包中,因此我们将其标记为初步证据而不是存档证据。我们描述了因式分解、位置修复、Token行闭包、稀疏 MoE 支持、TP8 集成以及解释这些结果所需的测量边界。