论文
SSL 语音模型的双语性如何?使用芬兰语和俄语 EMA 进行发音编码的跨语言探索
How Bilingual Are SSL Speech Models? Cross-Lingual Probing of Articulatory Encoding with Finnish and Russian EMA
摘要
SSL 语音模型从原始音频中捕获丰富的语音、韵律和声学模式,但它们如何编码跨不同语言的发音信息仍不清楚。使用来自芬兰-俄罗斯双语使用者的 EMA 数据,我们评估 SSL 潜在表征和发音运动之间的跨语言相关性。即使使用大约 5 分钟的训练数据,模型也能实现强大的预测性能(Pearson r 高达 0.68),并且多语言模型的表现优于单语言模型。中间层最有效地编码关节特征,并且舌头运动比嘴唇运动更可预测。我们还评估了任务类型(阅读与自发演讲)和语言能力的影响,发现结构化任务的准确性更高,并且跨能力水平具有很强的概括性。这些结果增强了 SSL 模型的可解释性,并展示了它们在语音技术应用中的潜力。