论文
GLASS:经过 GRPO 训练的 LoRA,用于零样本文本转语音中的声学风格转向
GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech
摘要
我们提出了 GLASS,这是一种零样本自回归文本转语音 (TTS) 中的可组合声学风格控制框架,它从后代奖励而不是风格标签中学习控制。在零样本 TTS 中,说话者提示常常将说话者身份与语速和音调等韵律属性纠缠在一起,因此很难在不改变提示本身的情况下改变风格。相反,GLASS 将每个声学属性视为奖励定义的控制方向。对于每个控制轴,GLASS 冻结 TTS 主干,并使用组相对策略优化 (GRPO) 训练一个轻量级 LoRA 适配器,使用语音标记长度和平均 F0 作为风格奖励,使用 WER 作为清晰度锚。由于每个控制都表示为 LoRA 权重更新,因此可以通过线性 LoRA 算法交换、插值和组合独立训练的适配器,而无需重新训练主干网络。语速和音调控制的实验显示了有针对性的风格转变,同时保留了自然度、说话者相似性和清晰度,并展示了独立训练的适配器的平滑插值和多轴组合。