论文

通过联合输出同策略蒸馏减少语音语言模型中的输出模式差距

Reducing the Output-Mode Gap in Speech Language Models via Joint-Output On-Policy Distillation

摘要

交错文本和声学标记的自回归生成是语音大语言模型中生成语音响应的常用方法。尽管这种设计可以通过明确的文本指导实现流式生成,但生成的声音标记成为后续文本预测上下文的一部分。给定相同的语音输入,我们观察到在语音到文本和语音 (S2TS) 模式中生成的内部文本的答案准确性明显低于语音到文本 (S2T) 响应。我们将这种差异称为\emph{输出模式差距}(OMG)。为了减少 OMG,我们提出 \emph{联合输出按策略蒸馏} (JO-OPD),它将模型更强的 S2T 策略蒸馏为使用学生生成的 S2TS 轨迹的联合生成。在每个文本位置,S2T 教师根据学生先前输出的纯文本投影提供软目标,而学生则根据相应的完整交错历史进行预测。保存目标进一步规范本机非文本预测。 Step-Audio-2-mini 和 Baichuan-Audio-Instruct 上的实验揭示了跨两种交错生成架构的 OMG。在 Step-Audio-2-mini 上,JO-OPD 在 Spoken-MQA 上将 OMG 从 42.87 个百分点降低到 16.26 个百分点,在语音呈现的 GSM8K 上将 OMG 从 29.72 个百分点降低到 13.04 个百分点,S2T 准确度几乎没有变化,并且比匹配的 SFT 基线大幅降低。基于 ASR 的评估进一步显示,Spoken-MQA 的口语回答准确性提高了 7.49 分。