自然普通话脊柱诊所咨询中开源语音情感识别的基准测试:试点验证研究
Benchmarking Open-Source Speech Emotion Recognition in Naturalistic Mandarin Spine Clinic Consultations: A Pilot Validation Study
摘要
语音情感识别(SER)可以在临床遇到的情况下实现被动情感监测,但大多数系统是根据实验室的表演语音而不是自然的普通话门诊咨询进行验证的。我们将三个开源 SER 模型(emotion2vec+、SenseVoice、FunASR)与自然脊柱诊所语音中的研究人员共识参考进行了基准测试,评估类别不平衡下的少数状态检测。在对前瞻性收集的单中心录音的回顾性分析中,音频被响度标准化,并且仅保留患者、家庭成员和临床医生之间的对话。 65 个话语(5-50 秒;每个参与者一个;31 名患者,34 名家庭成员)由 6 个校准注释器标记为 6 个类别(快乐、悲伤、恐惧、愤怒、中立、惊讶)。共识使用多数投票与 Fleiss kappa 过滤和临床医生对低一致性部分的裁决。指标包括未加权准确度 (UA)、每类宏观平均准确度、类和样本级别加权准确度 (WA) 以及 Bootstrap 95% CI 的 F1。标签不平衡(中性 58.5%); Fleiss kappa 中位数为 0.230 (IQR 0.134-0.519)。 SenseVoice 和 FunASR 的 UA 为 61.5%(95% CI 49.2-73.8%),每类宏观平均准确度为 87.2%,类级 WA 为 92.5%,样本级 WA 为 24.6%。 emotion2vec+ 的 UA 为 55.4%(95% CI 42.5-67.7%),每类宏观平均准确度为 85.1%,类级 WA 为 90.6%,样本级 WA 为 24.2%。尽管模型间一致性很高(90.8%),但所有模型对悲伤、恐惧、愤怒和惊讶的召回率几乎为零。在这个试点中,多数类别的准确性具有误导性:SER 在嘈杂的自然主义参考中很难检测到少数情绪。如果没有领域适应、多模态建模、更强的参考标准和结果验证,就无法从行动语料库基准推断临床部署准备情况。