论文
我们可以信任 LLM 进行心理健康筛查吗?一致性、ASR 稳健性和证据 忠实性
Can We Trust LLMs for Mental Health Screening? Consistency, ASR Robustness, and Evidence Faithfulness
摘要
LLM 可以以零样本的方式根据语音估计医院焦虑和抑郁量表 (HADS) 分数,但临床部署需要三个维度的可靠性:模型内一致性、ASR 稳健性和证据 忠实性。我们使用 真值 转录本和三个 Whisper ASR 变体(大、中、小)对 111 名英语参与者评估了三个 LLM(Phi-4、Gemma-2-9B 和 Llama-3.1-8B),每个模型条件对进行 3 次独立运行。我们发现 (i) Phi-4 和 Gemma-2-9B 在 ASR 下实现了出色的模型内一致性 (ICC > 0.89),且降级最小; (ii) Llama-3.1-8B 显示出 ASR 脆弱一致性,ICC 在 10% WER 时从 0.82 下降到 0.36; (iii) 在 ASR 下,稳健模型的预测有效性在很大程度上得以保留; (iv) Phi-4 和 Gemma-2-9B 的关键词证据一致率超过 93%,但 Llama-3.1-8B 的关键词证据一致率下降至 77-81%。模型间关键词一致性远远低于评分水平一致性,揭示了评分与证据的分离,对临床可解释性产生影响。