论文
长篇同步语音翻译的实用评估方法
A Practical Evaluation Method for Long-Form Simultaneous Speech-to-Speech Translation
摘要
同步语音到语音翻译 (SimulS2ST) 可以实现实时跨语言通信,但现有的评估主要集中在简短或预先分段的语音,而不是长格式的连续输入。先前的方法很难重现并且做出不适用于端到端系统的假设。我们提出了一种长格式 SimulS2ST 的实用评估方法。给定源语音、预分割的源转录本和参考翻译,我们运行自动语音识别 (ASR) 并对生成的目标语音进行强制对齐以恢复 词元级 时间戳,然后应用基于句子嵌入的对齐器将目标文本与其相应的源句子进行匹配。这使得能够对延迟和质量指标(包括 YAAL 和 xCOMET)进行句子级计算,然后将其汇总为最终的系统级分数。在代表性 SimulS2ST 系统上的实验表明,该方法在实践中是有效的,并揭示了当前系统在长语音上存在大量延迟累积的问题。代码可以在这里找到 https://github.com/SakaiXue6666/Speech-to-Speech-Latency