论文

商用助听器中听众评价的语音理解难易度的大型数据库和预测模型

A Large-Scale Database and Predictive Model of Listener-Rated Ease of Speech Understanding in Commercial Hearing Aids

模型评测评测方法与指标

摘要

HearAdvisor 旨在为助听器消费者提供反映真实聆听体验的音频性能指标和录音。对于语音相关指标,HearAdvisor 历来使用 HASPIv2,这是一种旨在预测客观清晰度的指标,主要在模拟失真下进行验证。它与消费者对商业助听器的理解容易程度的评价之间的关系尚不确定。在这里,我们介绍了一个大规模的感知数据集和学习指标,用于衡量听众对语音理解的感知益处。自述有听力损失的网站访问者完成了一项受 MUSHRA 启发的盲听测试,他们按照“易于理解”五分制对商业助听器的录音进行了评分。该数据集包含 151,608 个评级,其中质量筛选后的评级为 104,298 个,涵盖 72 个真实声学场景中 83 个商业产品的 10,394 个双耳声学模型录音。为了预测这些评级,我们通过冻结的 Whisper 编码器传递辅助音频和匹配的干净语音参考,减去它们的内部表示,并根据所得的差异嵌入训练一个小型 MLP 头。在未进行训练的设备上,学习到的指标在场景级别上明显优于 HASPIv2(总体 r = 0.92 vs. 0.83;响亮 = 0.89 vs. 0.75;安静 = 0.79 vs. 0.58)。在嘈杂的场景中,性能达到听众评级的一半可靠性;在安静的场景中,它接近天花板。该模型还可以对受控增益和 SNR 操作做出明智的响应。数据集和模型共同提供了一种新方法来预测真实商业助听器录音的听众评价的语音理解难易程度。