论文
语音到语音翻译模型的基准测试
Benchmarking Speech-to-Speech Translation Models
摘要
语音到语音翻译(S2ST)发展迅速,但离线评估缺乏统一的协议:研究报告不重叠的度量子集,阻碍了直接比较。我们引入了 COMPASS,这是一个统一且可重复的基准测试框架,集成了 8 个维度的 46 个指标,并将其部署在来自 FLEURS 和 CVSS 的 1,248 种模型语言配置上,涵盖十多个语言对的级联和端到端架构。架构表现出互补的优势:在自然度和说话者保留方面最好与最差的差距超过 30%,但在翻译质量方面仍保持在几个点之内,因此单一指标排名系统地歪曲了系统质量。相关性过滤将每个方向 46 个指标减少到 10 个,三个轴在 X$\to$EN 和 EN$\to$X 上需要不同的指标(例如,TER/UTMOS 与 ChrF++/NISQA-MOS);这些子集保留了排名(Spearman 的 $ρ>0.80$),同时将评估时间缩短了 $\approx\times$。跨配音、播客和医学领域的人工验证表明,独立的 MOS 预测器无法预测听众的偏好,而顶级特定领域指标与人类判断相关 ($ρ\geq 0.90$)。我们发布了 COMPASS 作为领域感知 S2ST 评估的基础。