论文
建模、缩放和解码:通过非语言发声优化可控语音生成
Modeling, Scaling, and Decoding: Optimizing Controllable Speech Generation with Nonverbal Vocalizations
摘要
非语言发声(NVV)的可控合成对于自然和富有表现力的语音至关重要,但由于其声学多样性和现有语料库中的不平衡分布,仍然具有挑战性。为了应对这些挑战,我们开发了一个 NVV 感知的 DiTAR 系统,该系统可以对连续语音潜在模型进行建模,将 16 个目标 NVV 类别编码为专用标记,并采用停止预测来区分中间发声和话语边界。训练首先对不同的 NVV 语音进行大规模双语预训练,然后对通过有针对性的合成增强和频率感知再平衡增强的语料库进行持续监督微调。在推理时,我们选择声音提示,调整 LM 引导和噪声注入尺度,并应用具有多指标选择的 Best-of-N 采样来减少生成失败。最终系统的官方加权双语得分为62.786,在ISCSLP 2026 NVVSpeech Challenge 的Track 2 中,普通话排名第一,英语排名第二,总体排名第一。消融研究表明,有针对性的增强对代表性不足的 NVV 类别的益处最大,而稳健的候选选择需要平衡 NVV 正确性、词汇保真度和感知质量。