论文

重新思考语音编解码器:从压缩到自回归生成建模

Rethinking Speech Codecs: From Compression to Autoregressive Generative Modeling

模型训练预训练

摘要

语音语言模型的最新进展利用预训练编解码器的离散语音表示来实现可扩展的训练和生成。然而,现有编解码器主要针对压缩进行优化,而没有考虑语言 模型训练 的自回归性质,从而导致在对压缩语音标记进行建模时性能不佳。在这项工作中,我们从生成建模的角度重新审视语音离散化,并提出一种新颖的框架,将语音标记化与自回归训练明确地结合起来。我们的方法在编解码器训练期间引入了自回归兼容约束,鼓励表现出时间一致性和可预测性的标记序列。此外,我们提出了针对不同层语音标记的异构下采样策略,区分语义层和声学层,以改善语义标记与相应文本内容之间的对齐。跨多个基准的广泛实验表明,我们的方法弥合了语音压缩和生成建模之间的差距,从而能够对语音数据上的现有语言模型进行更有效的持续预训练。该方法持续提高了多个编解码器的性能,验证了其通用性和对不同语音建模场景的适用性。