论文

WnW:用于长格式语音的盈亏 KV 缓存 LLM

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

模型推理KV Cache

摘要

长格式音频输入使 KV 缓存成为语音 LLM 的主要内存成本。仅预填充 KV 压缩方法一旦被逐出,就会永久丢弃音频 KV 位置,并且在解码期间没有途径恢复它们。我们证明这在长格式音频上是脆弱的:预填充注意力集中在音频开始附近(注意力下沉效应),而解码时注意力分布广泛,并且两个排名重叠较弱。我们提出了WnW(Waxing-and-Waning KV cache),它通过离线校准将KV-heads分为锚定、潮汐和固定角色。锚头将所有音频 KV 保存在 GPU 上,并生成每个词元从哪个音频区域读取的解码时间信号;潮汐头保留 CPU 驻留补充,根据聚合的锚头分数逐块调用;固定头仅保留 GPU 上的子集,其余部分将永久丢弃。在具有两个 3B 主干(Voxtral-mini-3b 和 Qwen2.5-Omni-3B)的 LibriSpeech-Long 上,WnW 保留接近全缓存的精度,同时在 GPU 上仅保留 20% 的音频词元,其中仅预填充基线无法终止。结果可以概括为跨语言、任务和领域转换,并且 CPU-GPU 召回在我们的测量中几乎没有增加解码时间开销。