论文

WavCube:通过语义—声学联合建模统一语音理解与生成表示

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

应用与实践内容创作

摘要

集成语音理解和生成是构建统一语音模型的关键一步。然而,这两项任务所需的不同表示目前带来了重大的兼容性挑战。通常,面向语义的特征是从自监督学习(SSL)中学习的,面向声学的特征是从重建中学习的。这种碎片化的表示阻碍了真正统一的语音系统的实现。我们提出了 WavCube,这是一种源自 SSL 语音编码器的紧凑连续潜在表示,可同时支持语音理解、重建和生成。 WavCube 采用两阶段训练方案。第一阶段训练语义瓶颈来过滤流形外的冗余,这使得原始 SSL 特征难以扩散。第二阶段通过端到端重建注入细粒度的声学细节,而语义锚定损失确保表示仍然扎根于其原始语义流形内。综合实验表明,尽管进行了 8 倍维度压缩,WavCube 仍然非常接近 SUPERB 上的 WavLM 性能,实现了与现有声学表示相当的重建质量,提供了最先进的零样本 TTS 性能以及明显更快的训练收敛速度,并且在 SUPERB-SG 基准上的语音增强、分离和语音转换任务中表现出色。系统消融表明,WavCube 的两阶段方案解决了生成建模的 SSL 特征的两个固有缺陷,为未来的统一语音系统铺平了道路。代码和检查点可在 https://github.com/yanghaha0908/WavCube 获取。