论文
以冻结离散扩散语言模型做音频原生语音识别
Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model
摘要
自动语音识别由一次发出一个token的自回归解码器主导。我们追问离散扩散语言模型能否转写语音——在少量去噪步内并行精炼整份转写。我们为DiffusionGemma训练音频原生接口:一个260亿参数混合专家模型,以均匀随机token离散扩散而非近期扩散语言模型常见的吸收掩码方案生成文本。冻结的Whisper编码器提供声学特征,轻量投影器把它们映射进模型嵌入空间,低秩适配器让冻结骨干关注新模态。仅训练约4,200万参数——占骨干的0.16%。我们发现自然训练目标无法落地音频:其梯度只经过早已“排除”投影器的注意力到达投影器;经冻结输出头施加连接时序分类(CTC)损失打破这一僵局。所得模型在LibriSpeech test-clean达到6.6%词错率,不论语句长度都以约八步并行转写,并使用单一六语言训练的适配器——本文在英语、印地语与普通话上评估。
