论文
X-Translator:实时多语言、说话人感知的语音翻译
X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System
摘要
实时语音到语音翻译 (S2ST) 系统必须平衡翻译质量、延迟、语音自然度和说话者一致性。公开记录的 S2ST 系统具有先进的直接、多语言、流媒体和表达性建模,而专有产品和 API 越来越多地向用户公开实时翻译功能。然而,对于开放和可复制的系统来说,实际部署仍然具有挑战性,特别是在长格式和多说话者对话中,其中部分 ASR 假设不稳定,话轮边界不明确,并且必须通过适当的说话者提示生成目标语音。我们推出了 X-Translator,这是一种低成本模块化级联 S2ST 系统,它通过会话级运行时控制器将流式 ASR、机器翻译和提示条件 TTS 结合在一起。该系统使用增量分段确认将不稳定的 ASR 流转换为可翻译的单元,并使用在线说话人提示管理器将源语音范围绑定到特定于说话人的语音提示以进行合成。我们使用 OpenSTBench 评估翻译、语音质量和延迟,与作为行为基线的专有语音翻译 API 进行比较,测量长格式语音稳定性,评估多说话人对话中的说话人保留情况,并评估多语言翻译质量。 X-Translator 提供了一个开放平台,用于了解面向部署的 S2ST 的实际权衡。代码和演示可在 https://github.com/zhaoyx239/X-Translator 获取。