论文
STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准
STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity
摘要
语音到语音翻译 (S2ST) 不仅应保留词汇含义,还应保留表达属性:情感、场景风格(例如新闻报道与戏剧性对话)和非语言发声 (NV)。此外,大规模收集既忠实翻译又与源表达一致的跨语言目标语音是很困难的,这使得基于参考的评估不切实际。我们推出 STEB(语音到语音翻译表达力基准),这是一个时长 32.6 小时的汉英基准测试,评估标准维度(翻译保真度、说话者相似度、持续时间对齐)和表达力维度(情感、场景风格、NV 保留)。对于表达能力评估,STEB 使用“先描述再总结”框架,将语音转换为结构化表达属性,并与 LLM 判断器比较源属性和假设属性。人类验证显示,在所有表达维度上,与听众的判断都存在统计上显着的相关性。我们评估了六个 S2ST 系统,涵盖级联系统、端到端模型和语音 大语言模型。许多系统,尤其是级联系统,实现了很强的翻译保真度,但它们仍然在情感保留(最佳:3.82/5)和 NV 保留(最佳:2.31/5)方面遇到困难。这些结果揭示了语义迁移和表达迁移之间的差距,将表达性保存视为 S2ST 的一个公开挑战。音频样本可在 https://cmots.github.io/steb.github.io/ 获取。