论文
SimulS2ST-Omni:显式轨迹监督下的数据高效流式语音翻译
SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision
摘要
长格式流式语音到语音翻译 (S2ST) 需要在严格的延迟限制下进行增量、无限制的翻译。现有方法通常受到句子限制监督或需要大量配对 S2ST 监督的影响。我们引入了一种训练方法,仅使用 $\sim$2k 小时的配对跨语言 S2ST 数据(分层在辅助监督之上)即可实现句子级和长格式流式 S2ST 的语音语言模型。以辅助多任务训练为基础,即使配对 S2ST 预算本身减少 90%,我们的方法仍然保持稳健。我们的核心贡献是联合文本代码轨迹监督,将目标文本和声学语义代码安排为统一的承诺路径,从而消除了对单独的、不稳定的语音侧发射控制器的需要。此外,我们的双流 Thinker-Talker 分解通过将语言推理与密集声学预测解耦以减轻模态干扰,显着优于统一解码器基线。最后,我们的系统在 RealSI 和 ACL60/60-dev 上实现了极具竞争力的质量延迟权衡,与 ASR-BLEU 上的 LiveInterpret~2.0 等最先进的闭源 S2ST 系统相匹配。