论文

通过语音印象引导伪三元组构造实现可扩展方向跟随 TTS

Scalable Direction-Following TTS via Voice Impression-Guided Pseudo Triplet Construction

模型训练合成数据

摘要

配音演员经常重新阅读相同的剧本,同时根据表演指示修改其表达方式。我们将这种设置研究为方向跟踪 TTS,其中系统生成新的话语,反映相对于参考话语的给定方向,同时保留说话者身份和语言内容。一个关键的挑战是缺乏捕获此类相对修改的训练数据。为了解决这个问题,我们提出了一种可扩展的伪三元组构造管道,它生成〜(参考话语,方向文本,修改后的话语)三元组。它使用印象可控的 TTS 模型生成受控的风格变化,并使用 LLM 根据估计的印象差异生成自然语言方向。实验结果表明,仅伪三元组就可以实现稳定的说话人保留修改,并且结合伪数据和记录数据进一步改善方向对齐,同时保持说话人相似性。我们的演示页面上提供了音频示例 https://ntt-hilab-gensp.github.io/IS2026pseudo/