论文
跟踪从语音学习的自监督模型中语言结构的出现
Tracking the emergence of linguistic structure in self-supervised models learning from speech
摘要
自监督语音模型学习口语的有效表示,这些表示已被证明反映了语言结构的各个方面。但模型训练什么时候出现这样的结构呢?我们研究了用荷兰语口语训练的六个 Wav2Vec2 和 HuBERT 模型的跨层和中间检查点的各种语言结构的编码。我们发现不同层次的语言结构表现出明显不同的分层模式以及学习轨迹,这可以部分地通过它们对声学信号的抽象程度以及集成输入信息的时间尺度的差异来解释。此外,我们发现定义 预训练 目标的级别强烈影响语言结构的分层组织和学习轨迹,并由高阶预测任务(即迭代细化的伪标签)引起更大的并行性。