论文
X-AuT:以跨尺度蒸馏渐进压缩语音大模型音频编码器
X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation
摘要
减少音频编码器深度可以降低语音 大语言模型 的推理成本,但删除完整的块会扰乱解码器消耗的嵌入,并可能导致删除和过早的序列结束错误。我们引入了 X-AuT,这是一个渐进式框架,它通过短行为探针选择层组合,并通过表示对齐、跨尺度 蒸馏、预定的学生策略监督和 LoRA 微调来恢复修剪后的模型。语言模型主干保持冻结,而注意力 LoRA 适配器和绑定输出嵌入在 蒸馏 期间进行调整。训练使用转录一致性管道中的最高一致性层级,然后在微调期间重新加权源。在十个公开的中英文基准测试中,将 Qwen3-ASR-0.6B 从 18 层压缩到 16 层音频编码器,将宏观平均误差从 5.61% 降低到 5.27%。 14 层模型达到 5.75%,音频塔参数减少 20.7%。在匹配的配方下,1.7B 教师的平均误差为 5.55%,而自我 蒸馏 的平均误差为 8.45%,并且渐进式 18$\rightarrow$14 剪枝优于直接剪枝(5.75% vs. 6.73%)。这些单次运行结果建立了两个实际操作点,并表明不同基准的准确度效果有所不同。项目网站:https://xpeng-ai.github.io/x-aut