论文

自我指导:通过解码器流形对齐增强神经编解码器

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

应用与实践内容创作

摘要

基于矢量量化 VAE (VQ-VAE) 的神经语音编解码器是语音 LLM 的核心音频分词器,但其重建保真度受到量化误差的瓶颈。修改量化器或增加模型容量是常见的修复方法,但它们使下游语言建模变得复杂。我们的核心思想是在处理量化标记及其原始连续嵌入时,使用轻量级特征映射损失来对齐解码器的内部特征流形。这需要最小的训练开销并且无需改变推理时间。应用于 XCodec2 时,自引导改进了所有重建指标,实现了最先进的低比特率性能。值得注意的是,它可以在不损失保真度的情况下减少 4 倍的码本,下游 TTS 实验表明,通过简化词元建模空间,显着改进了基于 LLM 的合成。多个统计观察和可视化证实了解码器中增强的内部流形对齐。大量的实验证实了它在各种归纳偏差中的普遍性。因此,自引导为高保真神经音频编码建立了一种有效的、广泛适用的方法。