模型
dots.tts.edit 扩展同一连续自回归基座:文本/情绪/音高语速/停顿四类组合编辑一次生成完成
小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
概述
团队在 dots.tts 生成基座之上继续探索语音精确编辑,训练出 dots.tts.edit:利用连续自回归架构把文本条件与连续语音潜表示纳入统一条件生成框架,源文本、源语音、编辑指令与目标文本共同构成上下文,由同一模型生成编辑后的目标语音,在保证未指定区域内容、说话人特征与声学连贯性的前提下完成修改。支持四类操作且可组合于同一条指令、一次生成完成:替换或插入删除文字;改变整句或局部片段的情绪;调节指定片段的音高与语速;在文字边界插入、延长或缩短停顿。为检验编辑效果,团队同时提出双语评测套件 doteBench,共 2,081 个案例,其中 1,841 个单项编辑案例覆盖文本、情绪、韵律和停顿,240 个组合案例要求一次完成多项编辑;评测同时检查目标指令是否执行、未编辑区域是否保持(WDTW-Dur / WDTW-F0 / SpkSim)与完整音频是否自然,论文评测的开源模型中 dots.tts.edit 在五类任务上取得整体领先的指令跟随与局部保持表现。