论文
以转写侧通道压缩全双工语音 KV Cache
Acoustic-to-Text KV Compression for Full-Duplex Speech Models
摘要
全双工语音语言模型不断累积声学键值 (KV) 状态,使长时间运行的交互占用大量内存。在收听过程中,模型可以在下一个音频单元到来之前完成对一个音频单元的处理;我们将剩余间隔收听时间称为松弛时间。我们提出了声音到文本的 KV 压缩,它引入了转录侧通道,以在此间隔内将传入的语音转换为紧凑的文本内存。当推理期间缓存超出目标预算时,旧的声学状态将被逐出,而转写文本和最近的声学上下文仍然保留。我们使用转录片段上的交叉熵来训练 LoRA 的侧通道。为了保留听力和口语行为,我们将知识蒸馏应用于原始模型在本机预测位置的标记级输出分布。在十分钟的 LongSpeech 会话中,与未逐出的相同模型相比,我们的 MiniCPM-o 4.5 实现将峰值流 KV 缓存大小减少了 64.6%。所提出的方法还改进了基线的转录、时间问答和摘要。FullDuplexBench评估进一步显示了可比较的暂停处理、轮流和中断性能。
