论文

具有解耦时间深度扩散的内存高效音频合成 Transformer

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

模型优化端侧模型

摘要

Siri Expressive Voices 完全在设备上实时合成丰富、可配置的语音,由 Apple 最强大的设备基础模型 AFM 3 Core Advanced 提供支持。这项工作展示了该功能背后的内存高效音频合成架构:一个 detokenizer,可在 Apple 矩阵协处理器 (AMX) 紧张的计算和内存预算内将基础模型发出的语义音频词元转换为高保真音频。我们通过三组件设计(流编码器、时间解码器和深度解码器)将语义音频标记转换为残差矢量量化(RVQ)表示,系统地解耦时间和深度处理。具有扩散 Transformer (DiT) 式阶段条件的单个可重用深度解码器可自回归生成所有 RVQ 级别,取代了先前多解码器架构的专用每级解码器,而具有固定窗口键值缓存的因果滑动窗口注意可产生与序列长度无关的恒定内存复杂性。 Detokenizer 部署在 AMX 上,每个生成步骤维持约 10 毫秒,比实时速度快约 16 倍,峰值运行时内存仅为 21 MB 和 329 MB 设备上资产,可实现 20-320 秒音频的连续流合成。这种恒定的小占用空间取代了传统 Transformer 和基于 GAN 的方法的线性和二次内存扩展。消融研究验证了关键架构组件,音频质量评估证实该架构保持了合成保真度,同时实现了比现有方法更高的效率。在 AFM 3 Core Advanced 中以 10 亿个参数激活大小运行时,与之前的设备上文本转语音系统相比,它的总体平均意见得分提高了 +0.28(4.15 对 3.87),会话语音提高了 +0.42(4.24 对 3.82)。