论文
OpenSTBench:语音翻译的统一多维评测
OpenSTBench: Beyond Semantic Evaluation for Speech Translation
摘要
语音翻译系统越来越多地涵盖语音到文本翻译 (S2TT)、语音到语音翻译 (S2ST)、离线翻译和流生成,产生模态、语音实现和计时行为不同的输出。现有的评估实践评估翻译质量、语音质量和时间质量等重要方面,但这些方面通常是在单独的协议下评估的,因此很难全面比较异构系统。为了解决这一差距,我们提出了 OpenSTBench,这是一个统一的多维评估框架,它将异构语音翻译输出组织成共享的评估格式。 OpenSTBench 支持离线和流式设置中的 S2TT 和 S2ST 系统,并联合评估翻译质量、语音质量、说话人保留、情感和副语言保真度、时间一致性和延迟。通过对代表性语音翻译系统的实验,我们表明具有较强翻译质量的系统在语音质量和时间质量方面仍然存在很大差异。 OpenSTBench 提供了一个可重现的协议,用于分析这些跨维度差异并支持语音翻译系统的面向应用的比较。代码和数据集可在 https://github.com/sjtuayj/OpenSTBench 获取。