论文
EntangleCodec:通过语义声学纠缠的统一离散音频分词器
EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement
摘要
音频分词器充当连续音频和音频语言模型 (ALM) 之间的离散接口,但现有的分词器通常难以支持理解和生成。面向重建的编解码器保留了声音保真度,但缺乏丰富的语义,而语义感知标记器通常依赖于单独的语义和声音流,从而引入冗余或错位。我们提出了 \textbf{EntangleCodec},一个统一的离散音频标记器,它在量化之前学习音频描述对齐的语义声学表示。通过将音频与丰富的音频描述(而不是 ASR 转录本)对齐,EntangleCodec 在紧凑的词元流中捕获语言内容、说话者身份、情感、韵律和声学场景。流匹配扩散解码器进一步实现了语音、音乐和一般音频的高质量重建。 EntangleCodec 实现了与专用编解码器相媲美的重建质量,在 MMAR 上的音频理解方面优于所有基于编解码器的基线高达 \textbf{+7.4\%},并在统一框架中支持 TTS 和 TTA 生成。此外,基于 EntangleCodec 的音频语言模型表现出强大的缩放行为:即使在 \textit{0.6B} 参数下,该模型也超越了专门的连续表示 LLM,在三个基准测试中使用了超过 \textit{13B} 参数,使用了 \textbf{22$\times$} 更少的参数;扩展到 \textit{8B} 进一步在 MMAR 上建立了新的最先进结果,强调表示质量与音频语言建模中的模型规模一样重要。代码和模型权重可在 https://github.com/luckyerr/EntangleCodec 获取。