论文
MoVE:通过语音转语音翻译中的发声专家来翻译笑声和泪水
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation
摘要
最近的语音到语音翻译(S2ST)系统实现了很强的语义准确性,但始终消除非语言发声(NV),例如传达务实意图的笑声和哭泣,这严重限制了现实世界的实用性。我们通过三项贡献来解决这个问题。首先,我们提出了一种用于构建可扩展的表达数据集的综合管道,以克服数据稀缺的限制。其次,我们提出了 MoVE,一种 LoRA 专家混合架构,具有表达专用适配器和软加权路由器,混合专家以捕获混合表达状态。第三,我们证明预训练的 AudioLLM 可实现惊人的数据效率:30 分钟的精选数据足以实现强大的性能。在英汉 S2ST 上,与强基线进行比较时,MoVE 在 76% 的情况下再现了目标 NV,并在所有比较系统中实现了最高的人类评价的自然度和情感保真度,其中现有的 S2ST 系统最多保留了 14% 的 NV。