论文

语音表示在阅读和自发语音中是否保留地区口音?

Do Speech Representations Preserve Regional Accent Across Read and Spontaneous Speech?

模型评测鲁棒性、公平性与可信度评测

摘要

在匹配的条件下可以捕捉到区域口音线索,但目前尚不清楚它们在朗读和自发演讲之间是否持续存在。我们研究了 RVG1,其中有来自 9 个地区的 500 名德语使用者,比较了匹配条件下的区域分类和连续地理定位以及与说话人无关的阅读自发迁移的 10 种语音表示。 Whisper 在匹配条件下表现最佳,达到 0.489 九向 UAR 和 148 公里中位地理定位误差,但跨传输方向下降至 0.11/0.18 UAR 和 363 公里地理定位误差。自监督模型显示出类似的退化,而说话者嵌入在域内的区分性较小,但在传输下更加稳健。这种对比在分类和地理位置上是一致的。在各种表示中,鲁棒性与表示在风格之间的变化程度(风格不变性)相关,对此跨风格说话人检索是一个可解释的代理。尽管渠道特征有所贡献,但年龄、性别、句子重叠和持续时间控制并不能解释这一差距。这些结果表明,强大的匹配条件性能并不表明强大的区域信息。

语音表示在阅读和自发语音中是否保留地区口音?的原论文方法或结果图
图 1:研究概述。在匹配条件下和与说话人无关的阅读自发迁移下,对德国区域分类和地理定位评估了十种语音表示。