论文
HybridCodec:对高效语音语言模型的离散和连续表示进行建模
HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models
摘要
离散音频表示在构建多模式文本音频系统以及将音频功能集成到 大语言模型 (LLM) 中变得越来越流行。然而,大量研究报告称,由于离散化过程中的信息丢失,各种下游任务的性能下降。为了解决这个问题,我们提出了一种将时间压缩的离散标记与降维连续残差相结合的新方法。我们的框架由混合离散连续焦点调制编解码器和混合 Transformer 组成。该架构在离散域中执行自回归推理,并结合非自回归预测和连续残差上采样。实验结果表明,与纯离散方法相比,我们的方法显着提高了说话人特征的保留,同时减少了所需的自回归步骤的数量。