论文
OmniKVQuant:Omni-LLM 的 KV 缓存量化
OmniKVQuant: KV Cache Quantization for Omni-LLMs
摘要
随着全模式 大语言模型 (Omni-LLM) 一起接收音频、视频和文本,其 KV 缓存内存成本会增加。 KV 缓存量化是纯文本 LLM 中事实上的方法,但其在 Omni-LLM 中的应用仍未得到探索。在本文中,我们分析了 TurboQuant(一种代表性的基于旋转的 KV 缓存量化方法)在多模式缓存上的表现,并确定了两个关键问题:时间键漂移和异构值几何。为了解决这些问题,我们提出了 OmniKVQuant,这是一个 无需训练 框架,它 (i) 在输入流的每个短窗口上设置关键量化范围; (ii) 按模态单独轮换值。在 Qwen2.5-Omni 和 Qwen3-Omni 上,OmniKVQuant 启用 2 位 KV 缓存,同时在七个视听基准测试中大幅保留性能。我们进一步提供了一个融合的 Triton 解码内核,该内核在注意力期间解压 2 位缓存,因此不会构建密集的 FP16 缓存。代码:https://github.com/kaistmm/OmniKVQuant