论文

BareWave:波形原生流程匹配文本到语音

BareWave: Waveform-Native Flow-Matching Text-to-Speech

模型训练预训练

摘要

去除中间表示和单独训练的解码阶段已成为生成建模的一个重要方向。然而,在文本到语音转换中,高质量系统仍然通常通过波形合成之前的中间声学表示来构建。在这项工作中,我们提出了 BareWave,这是一个完全波形原生的框架,用于在流匹配 TTS 中直接生成文本到波形。我们认为这种设置提出了三个训练挑战:原始波形建模缺乏强大的预训练表征支架,不同阶段的训练受益于不同的噪声计划,数据空间感知目标不会自动共享速度空间流目标的时间结构。因此,直接波形训练很难有效优化,很难通过固定的配方推动强大的最终工作点,也很难整合有效的感知细化。在这种观点的指导下,我们开发了一个直接的文本到波形训练框架,该框架结合了训练时表示对齐、分阶段噪声调度和速度感知感知对齐(VAPA),同时在测试时保留单个波形本机推理路径,无需预训练组件。零样本语音克隆实验表明,在完全波形原生推理路径下可以实现强清晰度、说话人相似度和自然度,支持波形原生流匹配 TTS 作为实用方向。包含音频演示的项目页面位于 https://barewave.github.io/。