论文
AudioKV:高效大型音频语言模型中的 KV 缓存驱逐
AudioKV: KV Cache Eviction in Efficient Large Audio Language Models
摘要
大型音频语言模型 (LALM) 在语音处理方面树立了新的基准,但其部署受到长上下文推理期间键值 (KV) 缓存的内存占用的阻碍。虽然一般的 KV 缓存压缩技术在 LLM 中表现出色,但它们经常在音频领域因忽视声学信号的内在时间连续性而失败。为了弥补这一差距,我们提出了 AudioKV,这是一种新颖的框架,它通过硬件友好的语义声学对齐机制,稳健地优先考虑音频关键注意力头。具体来说,我们通过分析 ASR 任务中的注意力分数来识别这些模态专用头,并优先为它们动态分配 KV 缓存预算。此外,我们还引入了频谱分数平滑(SSS),这是一种基于 FFT 的全局过滤策略,旨在抑制高频噪声并从重要性分数中恢复平滑的全局趋势,确保以前所未有的精度更加平衡的词元选择。对多个 LALM(包括 Qwen 和 Gemma 系列)的广泛评估表明,AudioKV 的性能显着优于基线,同时提高了计算效率。值得注意的是,在 40% 的压缩比下,AudioKV 在 Qwen3-Omni-30B 上保持了接近完整的精度,仅下降了 0.45%,而传统方法则遭受灾难性的性能下降和重复。我们的代码将在接受后发布。