论文
LLM-Codec:神经音频编解码器满足语言模型目标
LLM-Codec: Neural Audio Codec Meets Language Model Objectives
摘要
神经音频编解码器广泛用作口语模型的分词器,但它们针对波形重建而不是自回归预测进行了优化。这种不匹配将声学驱动的不确定性注入到离散标记空间中,并增加了语言模型的复杂性。我们提出 \ours,它通过面向语言模型的目标增强编解码器训练,同时保持编解码器和 LLM 架构不变。我们引入了(i)使用美杜莎式多步头进行未来标记预测,以鼓励多步可预测性,以及(ii)通过记忆库对比损失来匹配音频和文本表示的语义对齐。可微分的 Gumbel 桥可实现从这些目标到编解码器的端到端梯度。在 SALMon 语音连贯性上,在 \ours 上训练的 token LM 达到 61.6% 的准确度(比 AUV 多 12.1 点),同时降低了困惑度 35。在 Codec-SUPERB-tiny 上,\ours 将语音 Mel 距离比 AUV 提高了 5.0%,同时实现了可学习性增益,这表明重建保真度和 token 可预测性可以一起提高。