论文

FAST-CAP:因果对齐的同时语音到语音翻译

All In Good Time: Causality-Aware Framework for LLM-Based Simultaneous Speech-to-Speech Translation

应用与实践机器翻译

摘要

大型语言模型(LLM)在低资源离线翻译方面表现出了强劲的性能;然而,由于缺乏具有高跨语言说话者保真度的因果对齐训练数据,将它们扩展到同步语音到语音翻译(Simul-S2ST)仍然具有挑战性。此外,现有方法依赖于固定翻译策略或置信启发法,导致质量不佳和延迟较高。我们提出了一种具有因果关系感知的 Simul-S2ST 框架,该框架具有新颖的数据管道,可生成高保真、因果对齐的片段,并改进语音传输。该框架引入了 (i) 分解 S2ST 架构 (FAST)、(ii) 因果感知自适应策略 (CAP) 和 (iii) 因果感知延迟指标。在 CVSS 西班牙语、德语和法语上进行的实验表明,FAST-CAP 持续改进了质量与延迟之间的权衡,与固定策略相比,实现了高达 +1.2 BLEU 和 26% 的相对延迟减少。尽管使用的训练数据比现有系统少得多,但 FAST-CAP 在语音翻译质量和说话者保真度方面实现了最先进的结果,同时延迟相对减少高达 38.8%。

FAST架构通过多流联合序列建模实现语音翻译与合成。
图2(图注摘要):FAST架构通过多流联合序列建模实现语音翻译与合成。