论文
CAAD:用于高效语音语言模型的对比音频感知 蒸馏
CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models
摘要
语音语言模型实现了推理能力,但常常受到大量参数计数和优先考虑语言先验而不是声学特征的倾向的阻碍。虽然对比解码通过对比音频感知和纯文本 logits 来增强音频证据依赖,但它会增加推理延迟。我们提出了对比音频感知 蒸馏 (CAAD),这是一个将教师的对比推理内化到学生模型的权重中的框架。为了克服双路径逐个词元对比 蒸馏 过程中的高计算训练开销,我们引入了同步教师强制策略。该机制以统一的伪真值为音频证据依赖,能够同时生成教师的对比分布的全序列,从而使学生能够有效地提取音频感知信号。总体而言,CAAD 在 Dynamic-SUPERB 上比标准 知识蒸馏 产生约 8% 的相对增益,并成功减少了 MCR-BENCH 中的语言偏差。