论文
通过潜在空间压缩流式神经音频编码器 蒸馏
Compressing Streaming Neural Audio Encoders via Latent-Space Distillation
摘要
Apple 设备上的系统范围听写完全在设备上运行,它转录的语音通过标记器到达基础模型:将波形的短窗口映射到语言模型读取的表示的编码器。由于该模型在指令跟随修剪下被稀疏地激活,因此在任何时候只有一小部分专家占用 DRAM,因此始终在线的分词器会竞争相同的内存,并且其参数计数直接影响功耗和延迟。在这项工作中,我们研究如何通过 蒸馏 压缩这样的标记器,既不将离散标记也不将输出分布作为监督目标,而是将模型实际消耗的潜在预量化器(两个标记接口共享的最后表示)作为监督目标。我们仅训练学生编码器,以在平方误差目标下回归教师的每帧潜在值,并使用单个仿射层吸收教师与学生的宽度不匹配。由于目标先于量化器和语言模型桥,因此一种方法涵盖了我们支持的两种标记接口,并且既适用于单独预训练的标记器,也适用于与语言模型联合训练的标记器。在 2.8 倍压缩下,在没有任何 微调 的六对师生对中的五对中,经过蒸馏的学生与教师的相对 WER 保持在 1.9% 以内,并且相对于具有相同容量的独立训练的分词器提高了 3.9%。