论文

为什么我们需要语音来评估语音翻译

Why We Need Speech to Evaluate Speech Translation

模型评测评测方法与指标

摘要

语音翻译模型越来越能够保留语音特定信息(例如说话者性别、韵律和强调),但评估指标仍然对此类现象视而不见。我们对两个针对性别一致性和韵律的对比数据集进行了基于文本和语音的质量估计指标的元评估,发现即使直接访问语音信号,两者也都存在不足。然后,我们训练 SpeechCOMET(一系列带有语音编码器的质量估计模型),并评估最先进的 SpeechLLM 作为评委。在标准质量估计方面两者都匹配或超过基于文本的 COMET,但两者都不能一致地评估特定于语音的现象。我们确定了三个原因:(1)当前编码器中没有可靠地保留特定于语音的特征,(2)模型倾向于忽略语音源信号,以及(3)质量估计训练数据包含的相关示例太少。我们发布了所有模型和代码,并认为进步需要专门的特定于语音的训练数据和真正以语音为条件的模型。