论文

当层选择误导语音抑制检测时

When Layer Selection Misleads Speech Depression Detection

模型评测评测方法与指标

摘要

预训练的语音表示越来越多地用于抑郁症检测,但在用于评估偏差的相同数据上选择最佳编码器层会报告性能。在 DAIC-WOZ 上,通过跨五个深度编码器系列的重复嵌套交叉验证,简单的 25 层最佳探测使 AUC 膨胀高达 $0.09$。在 real 潜在表示上的打乱标签上,在嵌套选择下,朴素的 best-of-25 仍然达到 AUC $0.59$ 与 $0.50$ ,并且这种偏差随着探测层数和较小样本的增加而增加,隔离选择,而不是信号,作为原因。该效果在第二个临床语料库和语言(Android、意大利语)上复制。在无泄漏选择下,对表示族进行公平比较,确定紧凑的、与任务一致的情感韵律模型与更复杂的 SSL、深度学习、音频LLM和基于编解码器的方法具有竞争力,同时使用 $\sim\!10^{3}\times$ 更少的可训练下游参数。将分析扩展到个体 PHQ-8 症状表明,在这种更细粒度的水平上仍然存在相同的选择偏差。我们认为,在探测小型临床语音数据集上的编码器层表示时,嵌套模型选择协议应该成为标准。

当层选择误导语音抑制检测时的原论文方法或结果图
图 3:每个症状 AUC($3$-rep CV,编码器池)。朴素与嵌套层选择:偏差在所有 $8$ PHQ-8 项目上复制;免选择 aff+tim+eGe 超过了每一项的嵌套。