论文

不流畅在语音翻译中的作用

The Role of Disfluencies in Speech Translation

模型评测基准与评测资源

摘要

当前的语音翻译系统(包括 SpeechLLM)是在经过清理的文本上进行训练的,并且倾向于去除不流畅的内容,例如填充的停顿和错误的开头,而不是翻译它们。我们证明这是有代价的:当言语被清理时,不流畅所带来的意义就会消失。为了系统地研究这个问题,我们引入了 Uh-Mazing,这是一个人工翻译、不流利注释的 Switchboard 语音基准,涵盖英语到八种目标语言。在这些语言和几种架构中,我们发现错误的开始和自我修复,而不是填充的停顿或话语标记,导致了大部分翻译质量的损失,而未能保持不流畅的模型往往会忽略它,而不是误译它。我们证明推理时间解码可以缓解这种情况而无需重新训练,并发布基准和代码。