论文

HoliTok:具有强大的语音生成和理解双重功能的连续整体标记化

HoliTok: A Continuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

模型架构新型架构

摘要

统一的语音基础模型需要一个整体的标记化空间,该空间既可以通过语言模型学习,又可以解码为高质量的波形。然而,现有的语音标记器通常无法同时满足这些要求,从而导致架构复杂性增加和训练设计涉及更多。我们提出了 HoliTok,一种连续的整体语音标记化模型,专为统一生成理解建模而设计。 HoliTok 将 48~kHz 语音编码为 128 维潜在的紧凑 25~Hz 序列。它采用渐进策略进行训练,共同保留信号级保真度,合并语义信息,并保持强大的潜在可学习性。基于这种标记化,我们构建了一个用于语音合成和识别的统一 AR+DiT 模型,其中相同的潜在序列支持特定代和统一代理解任务。实验表明,HoliTok 实现了有竞争力的重建保真度,提高了高质量和可控合成的生成学习能力,并且在评估的表示中,它是唯一一个无需额外优化技巧即可在我们的统一生成理解架构中稳健运行的表示。这些结果表明 HoliTok 可以作为有效的语音标记器和统一口语建模的基础表示接口。该代码位于:https://github.com/bovod-sjtu/HoliTok。