论文
CycleSpeech:指令控制语音合成和副语言理解的相互对齐
CycleSpeech: Reciprocal Alignment for Instruction-Controlled Speech Synthesis and Paralinguistic Understanding
摘要
指令控制的语音合成和副语言理解通常是独立训练的,这两项任务之间的相互反馈尚未得到充分探索。我们引入了 CycleSpeech,这是一个通过共享的结构化语音配置文件连接生成和理解的框架,该配置文件作为监督和相互反馈的共同目标。前向循环通过比较恢复的轮廓和目标轮廓来评估合成语音是否表达预期属性。后向循环评估从真实语音推断的轮廓是否可以指导源说话风格的重建。为了支持这两个方向,我们构建了一个包含 20,046 个示例配对指令、目标语音、说话者参考和结构化配置文件的双语数据集。以联合监督微调为基础,CycleGRPO 使用基于配置文件一致性和说话风格重建的互惠奖励来交替策略更新。固定的目标配置文件锚定来自不断发展的对手的反馈。这个过程既不需要人类偏好注释,也不需要额外的偏好训练奖励模型。对中文和英文基准的评估表明,在保持有竞争力的综合质量的同时,指令依从性和轮廓恢复得到了改善。与Step-Audio-2-mini相比,CycleSpeech的中文和英文指令匹配准确率分别提高了4.50和10.06个百分点。受控烧蚀进一步支持循环反馈对生成控制的贡献。这些结果支持结构化语音配置文件作为语音生成和副语言理解之间相互训练的接口。此 https URL 提供在线演示。