论文
HybridCodec:快速双流、语义增强的神经音频编解码器
HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec
摘要
随着多模态 大语言模型 的出现,神经音频编解码器作为语音标记器的流行度激增。具有语义和声学解缠结的新编解码器架构已经出现。将语义信息引入编解码器模型有两种主要方法:一种将语义信息从 SSL 表示提取到第一个 RVQ 层,而另一种则为语义和声学特征维护单独的流。我们提出了 HybridCodec,这是一种结合了两种范式的统一架构。它采用单独的语义和声学分支,同时将 SSL 表示提取到语义流中。这种设计确保了强大的解缠结,而无需在推理过程中使用 SSL 模型。 HybridCodec 在域内测试集和竞争性重建 (RVQ-all) 上表现出卓越的语义专业化 (RVQ-1)。我们展示了其在域外和零样本跨语言设置中的鲁棒性,比现有双流模型实现了 3 倍的加速。