论文

BiMTokenizer:通过双向状态空间建模在低比特率语音标记化中保持语义声学平衡

BiMTokenizer: Preserving Semantic-Acoustic Balance in Low-Bitrate Speech Tokenization via Bidirectional State-Space Modeling

摘要

语音编解码器充当连续语音信号和 大语言模型 之间的桥梁,但面临着声音保真度和语义保留之间的固有冲突。为了缓解这种冲突,最近的工作越来越多地采用双塔架构,通过单独的编码器来解耦语义和声学建模。然而,这些双塔设计会产生大量的架构开销。为了避免这种复杂性,我们重新审视单塔范例并提出 BiMTokenizer,这是一种低比特率语音编解码器(约 1.1 kbps),将双向状态空间主干与残余球形水蛭量化(RSLQ)相结合。双向主干增强了时间建模,而 RSLQ 提供了一个固定的、分离良好的晶格瓶颈,用于鲁棒的语义和声学标记化,而不会导致学习密码本崩溃。实验表明,BiMTokenizer 在干净和嘈杂的环境中实现了卓越的声学重建和低比特率编解码器基线中最低的 WER,同时使用的参数不到最近双塔基线的一半。此外,其强大的语义表示在下游语音理解任务上产生了强大的性能,证实了精心设计的单塔编解码器可以在低比特率下保持语义声学平衡。代码和模型权重可在 https://github.com/ZhangXinWhut/BiMTokenizer 获取。