论文
dots.tts.edit:使用连续自回归模型精确控制语音编辑
dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model
摘要
用于内容创建的语音编辑需要精确控制编辑应执行的操作以及应应用的位置。自由形式的自然语言提供了用于表达编辑请求的灵活接口,但其模糊性可能导致预期操作、参数或目标区域未指定。我们研究了一种精确而明确的语音编辑界面:带有 XML 样式标签的基于转录的结构编辑指令明确指定类型操作并将其本地化到转录跨度或边界。这种语义时间线避免了显式的时间戳对齐,并为组合编辑提供了外部可检查的契约。我们在dots$.$tts$.$edit中实例化界面,这是一个改编自连续自回归dots$.$tts基础模型的编辑器。四种代表性的语音创建控件涵盖词汇内容、情感表达、音调和语速传递,以及通过文本、情感、韵律和停顿编辑进行的时间短语。特定于任务的数据管道构建操作和范围控制对,同时保留每个目标区域外部的源派生上下文。我们进一步介绍了 doteBench,这是一个双语评估套件,可以测量四个控件及其组合的精确指令遵循、局部保留和音频质量。实验表明,其五个编辑类别的整体指令遵循和本地保存处于领先地位,而音频质量仍然与现有的开源系统相当。在三个 Seed-TTS-Eval 分片中,该模型在零样本 TTS 识别错误率和说话人相似度方面与基本模型的差异可以忽略不计。