论文

从部分语音学习何时提交的同时翻译

Learning When to Commit from Partial Speech for End-to-End Simultaneous Speech Translation

应用与实践语音交互与综合语音服务

摘要

同声语音翻译必须在源语音未完成时输出有用的目标文本,同时保留每个已提交token。我们利用其自身完整与部分波形翻译导出的前缀监督适配全句语音语言模型,既不需转写也不需人工翻译。我们比较单轮强制前缀与多轮追加式解码,用置信阈值控制推理时质量-延迟权衡,并以独立合成余量变化训练前缀密度。在FLEURS与CoVoST2的三个语言方向上,前缀训练改善未适配模型的质量-延迟前沿,置信度提供最宽且持续具竞争力的操作范围。多轮解码在低延迟下总体更强;多轮训练下提交校准误差整体下降63-68%、早期前缀下降68-80%,而单轮训练仅有适度整体校准增益且无早期前缀改善。小合成余量有时把前沿扩展到更低延迟(尤其在较短话语上),较大余量则损害翻译质量与校准。因此前缀适配改善同声语音翻译,尤其是多轮追加式解码下,而合成密度引入非单调的质量-延迟权衡。