论文
使用单个零初始化层将语音克隆添加到文本到音频视频模型
Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer
摘要
文本转音频视频 (T2AV) 生成模型根据文本描述生成视频及其配乐,但无法控制输出中的声音。我们证明,通过在其音频骨干 微调 之上添加单个零初始化线性层,可以将基本 T2AV 模型转变为语音克隆模型,以实现相对较短的训练计划,并在推理时以短参考记录为条件。参考通过两个互补信号注入:其扩散潜伏被预先添加到音频流中,并且全局说话人嵌入调制目标音频的词元。在涵盖 30 个说话人的 674 个说话人文本对的基准上,我们与五个强大的语音克隆文本到语音基线进行比较:我们的增强型 5B 模型在三个独立验证网络(ECAPA-TDNN、WavLM-SV、Resemblyzer)中获得了最高的说话人编码器余弦相似度 (SECS),统计上显着优于每个基线。该架构的一个副产品是,在推理时可以在没有视频路径的情况下评估音频路径,从而使整个音频-视频扩散环路的速度提高约 30 倍,同时保留语音克隆行为。