论文

分析 LLM 推理以揭示心理健康耻辱

Analyzing LLM Reasoning to Uncover Mental Health Stigma

模型评测鲁棒性、公平性与可信度评测

摘要

虽然 大语言模型 (LLM) 越来越多地被探索用于心理健康应用,但最近的研究表明,它们可能会对患有心理疾病的个人产生耻辱。现有对这种耻辱的评估主要依赖于多项选择题(MCQ),它无法捕捉模型底层逻辑中嵌入的偏见。在本文中,我们分析了 LLM 的中间推理步骤,以揭示隐藏的污名化语言及其驱动的内部原理。我们利用临床专业知识对针对患有心理疾病的个人的侮辱性语言的常见模式进行分类,并使用此框架来识别和标记 LLM 推理中的有问题的陈述。此外,我们还会对这些言论的严重程度进行评级,区分明显的偏见和更微妙、危害性较小的偏见。为了拓宽推理领域并捕获更广泛的模式,我们还通过纳入额外的心理条件来扩展现有的心理健康耻辱基准。我们的研究结果表明,评估模型推理不仅比传统的基于 MCQ 的方法暴露出更多的耻辱,而且还有助于识别 LLM 逻辑及其对心理健康状况的理解中的缺陷。