论文
语音基础模型真的能学习单词吗?
Do speech foundation models really learn words?
摘要
自监督语音基础模型现在广泛用于下游应用,包括传统语音识别以及作为语音感知语言模型中标记的基础。了解它们的用处的尝试主要集中在探索它们的表征区分音素和单词的能力。然而,单词的辨别能力并不一定意味着单词本身的专门表示。对单词的良好区分可以通过单词形式(音素)的良好编码来解释,而不是通过编码身份或句法/语义属性的独立于形式的单词表示来解释。通过使用残差部分出音素信息,我们表明,在后面的层中,HuBERT 和 wav2vec 2.0 通常会学习表示,这些表示以独立于本地语音内容的合理保真度对单词进行编码。我们证明,这种简单的解开方法可以增强单词发现任务中的高阶语言信息。