论文
探索跨生命周期说话人分类的语音基础模型
Exploring Speech Foundation Models for Speaker Diarization Across Lifespan
摘要
语音基础模型在广泛的语音应用中表现出了强大的可移植性。然而,它们对说话者二值化中与年龄相关的域变化的鲁棒性仍未得到充分探索。在这项工作中,我们在统一的端到端神经分类框架(EEND-VC)内提出了跨生命周期评估,涵盖涉及儿童、成人和老年人的对话中的语音样本。我们比较了零样本跨年龄推理、联合多年龄训练和特定领域适应下的模型。结果表明,当将针对成人特定语音训练的模型应用于儿童和老年人的对话数据时,性能会大幅下降。此外,跨不同年龄组的联合多年龄训练提高了鲁棒性,而不会降低规范成人对话中的二化性能,而有针对性的年龄组适应可以进一步提高二化性能,特别是在使用 Whisper 编码器时。