论文

用预训练语音表征评测儿童与成人指向语音的区分

Benchmarking Adult Addressee Classification Across Child- and Adult-Directed Speech Datasets

模型评测应用与实践模型能力评测鲁棒性、公平性与可信度评测语音识别与转写

摘要

在这项工作中,我们使用来自包含自然实验室和野外 CDS 和 ADS 的语料库的语音数据,对分类性能进行了全面分析,以区分儿童定向语音 (CDS) 和成人定向语音 (ADS)。我们使用自监督学习(SSL)表示以及一系列时间池表示为这些数据集建立分类基准,这些时间池表示通过将跨通道协方差纳入高维嵌入来超越一阶和二阶统计。此外,我们还探讨了这些表示,以检查不同的池方法如何使用线性探针捕获韵律信息。总体而言,基于 SSL 的表示被证明特别有效,可以实现最佳性能,而不同的池方法为该任务提供了互补的优势。

用预训练语音表征评测儿童与成人指向语音的区分:论文原图
图 1:分组 eGeMAPS 特征的平均 Pearson rr,根据 WavLM-Large 平均池嵌入和 logits 与 MB 和 ACLEW 的 eGeMAPS 的相关性计算得出。