LongCat-AudioDiT 发布并开源(1B/3.5B):波形潜空间扩散 TTS,Seed 基准零样本语音克隆 SOTA
突破零样本TTS音色克隆上限:LongCat-AudioDiT 的声音克隆艺术
概述
LongCat-AudioDiT 抛弃梅尔谱等中间表示,只用一个波形变分自编码器(Wav-VAE)和一个扩散 Transformer(DiT),在波形隐空间完成压缩、建模与重建。Wav-VAE 为全卷积音频自编码器:编码器通过多级 Oobleck 块层级下采样,块内堆叠带空洞卷积的残差单元,把 24kHz 波形压缩到约 11.7Hz 帧率、压缩比超过 2000 倍;每个编解码块引入非参数“空间到通道/通道到空间”捷径稳定训练;优化目标融合多分辨率 STFT 损失、多尺度梅尔损失、时域 L1 损失、KL 正则及多尺度 STFT 判别器的对抗与特征匹配损失。文本编码器用支持 107 种语言的 UMT5,并把原始词嵌入(第一层)与最后一层隐藏状态相加后经 LayerNorm 平衡 scale(仅用最后层无法生成可懂语音),另加轻量 ConvNeXt V2 序列模块加速文本-语音对齐收敛;DiT 骨干集成 Global AdaLN、QK-Norm + RoPE、长跳跃连接与 REPA(借 mHuBERT 自监督特征引导中间层加速收敛)。推理侧两项改进:一是首次发现并解决流匹配 TTS 的训练-推理不匹配——训练仅在掩码区算损失、推理时提示区却自由演化导致音色漂移,故在每步推理中把提示区隐变量强制重置为 ground truth,并在计算无条件速度场时移除提示区输入以避免信息泄漏;二是用自适应投影引导(APG)取代 CFG,把引导信号分解为平行与正交分量,保留正交(有益)分量、抑制平行(导致过饱和劣化)分量。潜空间配置经系统性对比确定为 64 维潜在维度 + 11.7Hz 帧率(VAE 重建质量好不等于生成效果好,单纯追高重建分会导致潜空间维度膨胀)。指标:Seed-ZH 说话人相似度 SIM 0.818(前 SOTA Seed-DiT 0.809)、Seed-Hard 0.797,超过 Seed-TTS、CosyVoice3.5、MiniMax-Speech 等;中文 CER 1.1B 为 1.18%、3.5B 为 1.09%;英文 WER 分别为 1.78% 与 1.50%(3.5B 为参评模型中第二低);中文难句 CER 3.5B 为 6.04%(同为扩散路线的 F5-TTS 为 8.67%)。模型未使用高质量人工标注数据与多阶段训练,仅用 ASR 转写预训练数据做单阶段预训练。 团队在发布当日把 LongCat-AudioDiT 两个尺寸(1B / 3.5B)的模型与代码完整开源:GitHub https://github.com/meituan-longcat/LongCat-AudioDiT 提供代码仓库,HuggingFace https://huggingface.co/meituan-longcat/LongCat-AudioDiT 提供模型权重,论文公开于 arXiv(https://arxiv.org/abs/2603.29339v1),正文开头与结尾两次以「开源平台链接」区块列出上述入口,开发者可直接获取并复现该波形潜空间扩散 TTS 方案。