论文
谁对困境进行评估?社区观点和 LLM 福祉帖子的一致性
Whose Assessment of Distress? Community Perspectives and LLM Alignment on Well-Being Posts
摘要
对心理困扰的判断是基于社会情境的:什么才是令人担忧的取决于关于情绪表达、脆弱性和寻求帮助的社区规范。然而,用于遇险检测的 大语言模型 (LLM) 通常符合单一的、无差别的标准。这些模型能否很好地捕捉其所评估语言的社区的观点?我们通过一项透视注释研究来解决这个问题,其中 321 名参与者对跨越 6 个基于身份的社区的 1,198 个 Reddit 帖子提供了 9,587 个判断,产生了社区特定的标签。与非情境化的外群体评分者相比,情境化的内群体条件下的评分者表现出更同意其社区的适度倾向(OR = 1.18),这种影响在不同社区之间存在显着差异。然后,我们根据这些标签评估九种开放权重 LLM 配置和四种前沿配置。开放权重 LLM 系统性地高估了痛苦:当社区感知到非轻微痛苦时,这些模型仅达到 31-44% 的准确度,主要产生误报。 GPT-5 和 Gemini 2.5 Pro 表现出相同的非温和通胀,即使它们的全样本高/低率混合在一起,而 Claude Opus 4 则更为保守。这种模式并不仅仅反映了局外人的解读立场:无背景的外群体人类总体几乎是对称的,高估率为 18%,低估率为 19%。相反,夸大非轻微案例的模型表现出一种痛苦先验,超出了情境化的内群体和非情境化的外群体人类判断。这些发现对于心理健康领域的公平人工智能部署具有影响,在这种情况下,错误校准的痛苦检测可能会不均匀地影响正在评估的社区。