论文

NVAlign:以可微奖励优化TTS非语言发声控制

NVAlign: Direct-Gradient Optimization for Non-Verbal Control in Continuous Autoregressive Flow Matching Text-to-Speech

模型训练奖励建模与过程监督

摘要

现代文本到语音(TTS)系统能生成高度自然的语音,并支持内嵌非语言发声(NVV)标签,但准确控制这些事件仍很困难。关键缺口在于,连续自回归流匹配TTS尚缺成熟的非语言控制后训练方法。我们提出NVAlign,一个面向这类架构NVV标签遵循的直接梯度后训练框架。首先在NVV标注语音上,对TTS模型与具有NVV感知能力的自动语音识别(NV-ASR)模型进行监督微调,再冻结NV-ASR作为后训练奖励模型。两步梯度代理使奖励能够高效穿过流匹配采样器反向传播,联合更新自回归骨干和声学流头。保真惩罚与参考速度正则化帮助保留说话人相似度和语音质量。NVV-SuperBench及人类听感评测显示,NVAlign相对于SFT和Flow-GRPO基线提高标签遵循准确率。这些发现表明,直接奖励梯度优化能够改善连续自回归流匹配TTS的非语言控制。音频样例已提供。 https://nvalign.github.io/