论文

从长时录音构建语音评测数据集:标准化、泛化与隐私

Deriving Benchmarking Datasets from Long-Form Recordings: Challenges and Opportunities

模型评测基准与评测资源

摘要

以儿童为中心的音频的长格式录音(LFR)是研究早期语言发展的生态有效来源,但三个问题限制了它们的使用。首先,LFR 语料库是跨站点收集的,具有异构的格式和同意结构,使跨语料库使用并不容易。其次,如果没有标准化的基准,评估工具是否能够跨语言和条件泛化是很困难的。第三,机器学习工作流程很少尊重管理敏感儿童语音的隐私约束。本文提出了一个解决所有三个问题的框架:使用开源工具构建的 27 个以儿童为中心的数据集的标准化集合(S1);用于四个语音处理基准的可复制管道(S2); ELSI,一个基于角色的生态系统,将道德治理嵌入到 ML 工作流程 (S3) 中。我们通过语音类型分类案例研究演示了该框架,并表明这三种解决方案是相互依赖的。