论文

语音翻译错误的自动标记

Automatic Labelling of Speech Translation Errors

模型评测评测方法与指标

摘要

语音翻译中的错误会降低语音翻译 (ST) 系统的可信度,并可能产生严重后果。然而,目前还没有既定的方法来评估语音翻译的置信度和质量估计。为了在这个方向上取得进展,我们提出了语音翻译错误标签(STEL)。我们创建一个注释协议,一个小型真实的端到端评估数据集,并分析现有的纯文本和语音处理系统如何执行 STEL 任务。我们的结果表明,纯文本 XCOMET 和多模态 LLM Qwen2.5-Omni 能够以大约人类一半的精度执行 STEL 任务。我们还发现直接语音处理对于 STEL 任务是必要的,并且当前的纯文本和语音处理系统在标记 ST 中的仅翻译与语音处理错误方面是互补的。