论文
UltraQuant:适用于上下文密集型代理的 4 位 KV 缓存
UltraQuant: 4-bit KV Caching for Context-Heavy Agents
摘要
上下文繁重的代理给键值 (KV) 缓存带来了巨大的压力:长前缀在许多短轮次中重复使用,而并发性决定了服务系统是否可以保持 GPU 的利用。我们针对此设置研究 4 位 KV 缓存压缩,使用 TurboQuant 式旋转和码书量化作为质量锚点,使用 vLLM FP8 KV 缓存作为部署锚点。我们报告了三项贡献。首先,我们围绕多轮代理工作负载构建 4 位 KV 缓存,其中必须联合测量任务质量、缓存驻留和服务吞吐量。其次,我们描述了使 4 位路径稳健所需的实际设计选择,包括不对称 K/V 处理、Walsh-Hadamard 旋转、QJL 去除和块尺度变体。第三,我们介绍了 AMD GPU 上的服务优化,包括优化的解码注意力内核和 UltraQuant、使用 FP8 查询的 FP4 近似路径、FP4 KV 张量、UE8M0 组尺度以及 CDNA4 上的本机缩放 MFMA 支持。在生产 Claude Code 跟踪的自适应 SLO 重放中,UltraQuant 维持 BF16 基线的合格请求吞吐量的 2.71 倍(MiniMax-M2.5)和 4.38 倍(Qwen3-235B),在使用一半 KV 字节的同时匹配或超过硬件 FP8 KV。 UltraQuant 在长上下文、高并发、内存受限的服务机制中取得了最大的进步。