论文
CHILDES-Aligned:通过多模型时间戳集成策划的儿童语音数据集
CHILDES-Aligned: A Curated Children's Speech Dataset via Multi-Model Timestamp Ensembling
摘要
CHILDES 是一个大型儿童语音语料库,包含自然儿童与成人互动的长格式录音,使其成为研究儿童语音和语言发展的宝贵资源。然而,该语料库中提供的话语级时间戳通常有噪音、不完整或与音频不一致。因此,在长录音中无法始终可靠地定位话语,这限制了直接使用这些数据来训练和评估语音模型。在这项工作中,我们提出了 BEACON(通过对齐共识进行边界估计),这是一种集成时间戳管理框架,通过聚合来自多个现成 ASR 模型的知识来细化话语级时间戳。具体来说,每个模型的单词级时间戳预测首先与提供的人类转录本对齐,最终的话语时间边界由共识投票策略确定。该框架与语料库无关,适用于任何与时间戳不可靠或丢失的可信记录配对的长格式记录,为时间戳管理提供了通用方法。利用这个管道,我们策划并发布了一个 413 小时的通用儿童语音数据集,其中包含纠正的话语级时间戳,以及用于 ASR 训练的 283 小时的质量控制子集。在四个域外儿童语音基准测试中,此子集上的 微调 平均相对 WER 降低高达 19.5%。