论文
超越转录的推理:儿童口吃语音的音频语言模型
Reasoning Beyond Transcription: Audio Language Models on Child Stuttering Speech
摘要
儿童言语在声学、韵律和语言结构上与成人言语不同。言语不流畅(例如重复)进一步挑战自动理解。虽然音频语言模型 (ALM) 从语音音频中表现出强大的语义推理能力,但它们在混合说话者环境中推理不流利的儿童语音的能力仍有待探索。我们通过两项任务对此进行研究:以儿童为中心的语义概括和语音蕴涵。实验使用了在混合演讲者访谈中口吃的儿童的录音,没有明确的演讲者分离。模型在指导下关注儿童,保留临床相关的不流畅性,并避免成人语音泄漏。评估结合了基于 LLM 的判断和基于参考的指标,并以转录预言机基线为锚定以隔离错误。结果表明,虽然 ALM 从口吃的语音中提取高级含义,但推理能力会随着口吃语音的增加而显着降低。