论文

ChildVox:理解和表征整个童年声音的语音、音频和大型音频语言模型基准

ChildVox: A Speech, Audio, and Large Audio-Language Model Benchmark in Understanding and Characterizing Sound across Childhood

模型评测基准与评测资源

摘要

我们推出了 ChildVox,这是一个新颖的基准,用于表征儿童交流的各种声音信号。具体来说,ChildVox 遵循从出生到学龄的完整发展轨迹,涵盖生理声音、非语言发声、规范音节和口语。 ChildVox 集成了 17 个以儿童为中心的音频和语音数据集的 20 多个子任务,实现了系统的跨语料库和跨领域比较。我们评估了一系列代表性的音频和语音基础模型,包括自监督、面向 ASR 和大型音频语言模型,其任务包括生理声音分类、发声和规范音节建模以及语音质量评估和识别。基准测试结果显示,ChildVox 提供了一套高性能模型,可以识别儿童的各种声音信号,支持下游应用,例如表征儿童的语言水平和跟踪年龄的语音产生。