论文
非语言发声合成的偏好优化
Preference Optimization for Non-Verbal Vocalization Synthesis
摘要
非语言发声 (NV),例如笑声、咳嗽和叹息,对于富有表现力的 TTS 至关重要,但对 NV 生成的偏好优化的有效性仍然知之甚少。我们系统地研究支持 NV 的 TTS 的偏好优化,重点关注偏好信号、偏好对构建和基于 DPO 的优化目标。我们通过将 NV 标签视为不同的输出符号,并针对言语和非言语内容计算基于加权拼音的 CER,制定了 NV 感知字符错误率 (NV-CER),从而无需修改底层优化算法即可实现 NV 实现的可控优化。在 Emilia-NV 和涵盖 18 种 NV 类型的增强 NV-Bench 上进行的实验揭示了不同的设计选择如何影响 NV 实现和词汇保真度,并使用标准 DPO 建立有效的设置。基于 LLM 的客观评估和人类评估为我们的研究结果提供了一致的证据,为表达 TTS 的 NV 感知 后训练 提供了实用见解。