论文
准备说话:对齐 LLM 以生成 TTS 友好的文本
Ready to Speak: Aligning LLMs for TTS-Friendly Text Generation
摘要
当前的 大语言模型 (LLM) 主要针对书面文本进行优化,通常生成语法正确且有用的输出,但不太适合通过文本转语音 (TTS) 进行口头交付。在这项工作中,我们研究如何使 LLM 原生生成 TTS 友好的文本,我们将其框架为偏好对齐问题:我们不依赖下游重写模块,而是直接对齐 LLM 以生成针对语音交付优化的文本。我们引入了两个跨越不同目标域的偏好数据集:CORA 和 Recipe,其中包含配对的 TTS 友好和 TTS 不友好响应。我们进一步提出了一个评估套件,结合了基于模式的启发式度量、TTS$\to$ASR 评估流程以及与人类评委一起进行的 MUSHRA 听力研究。我们的实验将最近提出的特征感知采样和调优 (FaST) 框架(利用可解释的特征而不是黑盒奖励模型)与 TTS 友好生成任务上的一系列对齐基线进行比较。值得注意的是,我们发现 FaST 在各种设置中实现了 TTS 友好性和有用性之间的最佳总体权衡。我们还发现不同指标之间存在很强的相关性,突出了通过有效启发式可靠评估 TTS 友好性的能力。