论文
自监督言语模型在儿童言语中编码年龄和性别的效果如何?跨多个架构的分层分析
How Well Do Self-Supervised Speech Models Encode Age and Gender in Children's Speech? A Layer-Wise Analysis Across Multiple Architectures
摘要
自监督学习(SSL)模型已成为现代语音处理系统的核心组成部分,因为它们能够在不依赖标记数据的情况下学习丰富的声学表示。尽管它们在成人语音方面取得了成功,但目前尚不清楚这些模型如何有效地捕获与说话者相关的属性,例如儿童语音中的年龄和性别,由于持续的生理和认知发展,儿童语音与成人语音有很大不同。更高的音调、增加的发音变异性以及年龄相关的声学变化使儿童的言语成为一个特别具有挑战性的领域。在这项工作中,我们全面分析了年龄和性别信息如何跨四种广泛使用的 SSL 模型的层进行编码:Wav2Vec2、HuBERT、Data2Vec 和 WavLM。使用轻量级 CNN 在两个基准儿童语音语料库 PFSTAR 和 CMU Kids 上提取并评估分层特征。为了分析特征的紧凑性和冗余性,应用 PCA 来识别冗余并突出显示对分类性能贡献最大的维度。实验结果表明,与年龄和性别相关的信息在 SSL 层中分布不均匀,早期到中期层编码最强的副语言线索。 HuBERT 在年龄分类方面取得了最佳的整体性能,而 Wav2Vec2 和 HuBERT 分别在 PFSTAR 和 CMU Kids 上领先性别分类。除了单分割评估之外,我们进一步证明这些发现在说话者交叉验证、层聚合和跨数据库评估下保持稳定,表明对数据不平衡和域不匹配的鲁棒性。最后,我们证明,即使是 1--3 秒的短语音片段,也可以实现可靠的年龄和性别分类。