论文
AST:自适应、无缝和 无需训练 精确语音编辑
AST: Adaptive, Seamless, and Training-Free Precise Speech Editing
摘要
基于文本的语音编辑旨在修改特定片段,同时保留说话者身份和声学上下文。当前的方法通常涉及昂贵的特定任务训练或采用预先训练的文本转语音 (TTS) 模型。然而,这两种范式都面临挑战:特定于任务的方法通常会降低未编辑区域的保真度,而 TTS 改编则在编辑自然度和时间保真度之间进行权衡。为了解决这些问题,我们提出了 AST,一种自适应、无缝和 无需训练 语音编辑框架。 AST 基于预先训练的 TTS 构建,利用潜在重组将保留的源片段与合成目标拼接起来,保证未编辑区域的保真度。为了打破质量可控性权衡,我们引入了自适应弱事实指导(AWFG),它可以调制梅尔空间信号以确保无缝边界过渡而不破坏生成流形。此外,为了解决时间保真度方面的评估差距,我们提出了一个新的基准套件:LibriSpeech-Edit 数据集和一个新颖的指标:字级动态时间规整(WDTW)。大量实验表明,AST 在内容准确性、感知质量、说话人保留和时间保真度方面始终优于现有的特定于任务和微调的语音编辑方法。值得注意的是,AST 在没有任何特定于任务的训练或配对编辑数据的情况下实现了最先进的零样本语音编辑性能,验证了潜在重组和 AWFG 在弥合质量可控性权衡方面的有效性。