论文

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

模型推理KV Cache

摘要

语音大语言模型的最新进展在理解复杂音频任务上展现出卓越能力。尽管如此,其长上下文推理仍严重受制于高昂的KV缓存内存需求。现有以文本为中心的压缩方法在此表现不佳,常破坏语音连续性或丢弃关键语义线索。为此,我们提出VoxZip,一个免训练的两阶段语义锚定KV缓存压缩框架。第一阶段使用自动语音识别(ASR)转写作为显式语义锚点,对音频token做时间对齐、压缩与融合,显著压缩初始KV缓存并提升token信息密度。为进一步提高压缩比,第二阶段采用基于时间衰减累积注意力的动态过滤策略,驱逐非必要token并缓解早期token偏差。在Qwen3-Omni上跨六个多样化音频基准的全面评估证明了本方法的优越性。VoxZip在长音频推理上表现出色,并在短音频任务上持续保持高保真感知。值得注意的是,在长上下文场景下即使进行激进的20倍KV缓存压缩,它仍保持未压缩基线性能的90%以上。此外,在4倍压缩比下,VoxZip带来1.9倍的推理吞吐提升与3.3倍的峰值内存开销降低。代码与模型将发布于 https://github.com/MM-Speech/VoxZip。

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩:论文配图
图1:Qwen3-Omni-Instruct-30B中的注意力分数分布。左:未压缩基线在原始音频与文本token上的注意力高度稀疏。右:语义锚定压缩使注意力变得更密集、更集中。