论文

压缩缓存,而不是语音嵌入:KV 压缩实现高效语音 LLM

Compress the Cache, Not the Speech Embedding: KV Compression for Efficient Speech LLMs

模型推理KV Cache

摘要

语音 大语言模型 (Speech LLM) 通常将语音编码为比文本长得多的序列,从而在自回归解码期间产生主要的效率瓶颈。常见的补救措施是在适配器级别压缩语音序列,以在进入 LLM 之前消除时间冗余;然而,这种早期的下采样有可能会丢弃无法恢复的细粒度信息。我们提出了 SpeechKV,它将学习池应用于 LLM 内语音词元的 KV 缓存。这种设计允许 LLM 在内部融合语音和文本,同时直接加速解码。 SpeechKV 在 71K 小时的语音数据上进行训练,将语音压缩到大约文本级粒度,但仍保持与未压缩基线相当甚至略好的性能,在域外实体识别上相对增益为 6.6%,在 OpenASR 上相对增益为 2.3%,同时提供至少 1.49 倍的解码加速(随音频长度而变化)。