论文
VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩
VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference
摘要
语音大语言模型的最新进展在理解复杂音频任务上展现出卓越能力。尽管如此,其长上下文推理仍严重受制于高昂的KV缓存内存需求。现有以文本为中心的压缩方法在此表现不佳,常破坏语音连续性或丢弃关键语义线索。为此,我们提出VoxZip,一个免训练的两阶段语义锚定KV缓存压缩框架。第一阶段使用自动语音识别(ASR)转写作为显式语义锚点,对音频token做时间对齐、压缩与融合,显著压缩初始KV缓存并提升token信息密度。为进一步提高压缩比,第二阶段采用基于时间衰减累积注意力的动态过滤策略,驱逐非必要token并缓解早期token偏差。在Qwen3-Omni上跨六个多样化音频基准的全面评估证明了本方法的优越性。VoxZip在长音频推理上表现出色,并在短音频任务上持续保持高保真感知。值得注意的是,在长上下文场景下即使进行激进的20倍KV缓存压缩,它仍保持未压缩基线性能的90%以上。此外,在4倍压缩比下,VoxZip带来1.9倍的推理吞吐提升与3.3倍的峰值内存开销降低。代码与模型将发布于 https://github.com/MM-Speech/VoxZip。
