论文

以冻结离散扩散语言模型做音频原生语音识别

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

模型训练监督微调与指令调优

摘要

自动语音识别由一次发出一个token的自回归解码器主导。我们追问离散扩散语言模型能否转写语音——在少量去噪步内并行精炼整份转写。我们为DiffusionGemma训练音频原生接口:一个260亿参数混合专家模型,以均匀随机token离散扩散而非近期扩散语言模型常见的吸收掩码方案生成文本。冻结的Whisper编码器提供声学特征,轻量投影器把它们映射进模型嵌入空间,低秩适配器让冻结骨干关注新模态。仅训练约4,200万参数——占骨干的0.16%。我们发现自然训练目标无法落地音频:其梯度只经过早已“排除”投影器的注意力到达投影器;经冻结输出头施加连接时序分类(CTC)损失打破这一僵局。所得模型在LibriSpeech test-clean达到6.6%词错率,不论语句长度都以约八步并行转写,并使用单一六语言训练的适配器——本文在英语、印地语与普通话上评估。

以冻结离散扩散语言模型做音频原生语音识别:论文配图
图 1:DiffusionGemma 中的均匀离散扩散。生成从随机词汇标记的画布开始,经过几个步骤,保留置信的预测并对其余部分进行重新噪声处理,直到画布退火为文本。不存在吸收掩模状态。