论文
LLM 中自杀检测的验证门控机制解释
A Validation-Gated Mechanistic Account of Suicidality Detection in LLMs
摘要
大语言模型 越来越多地被提议用于心理健康应用,例如检测自杀内容,这引发了他们依赖什么的问题。我们机械地研究这个问题,并用它来提出一个更狭隘的问题:如何使关于模型内部特征的因果关系更值得信赖。我们的验证门控框架以自杀检测作为案例研究,仅在模型被显示执行后才解释行为:只有当模型将其排在简单的词汇基线之上时,才会承认一个概念,并且每个后续属性都根据匹配的控制进行测试。这种纪律会产生消极和积极的结果。该门从一开始就排除了一项任务:在 DeepSuiMind(Li et al. 2025)上,Llama-3.1-8B-Instruct 无法将隐含的自杀意图与普通的痛苦分开,因此我们不对其进行分析。我们转向二进制自杀检测,它确实可以执行。在那里,我们发现了一个中间网络特征,它看起来是语义的,而不是基于关键字的,与决策有因果关系(消除它会降低判断力;随机方向不会),是低秩的,并且在三个模型系列和三个自杀数据集中重复出现。登记匹配对照(自杀与抑郁)表明它比一般痛苦更具体地跟踪自杀倾向。转向提高了模型的响应,但也针对不相关的问题,因此我们将其视为必要但不充分。最清晰的模式将编码与使用分开:较小的模型已经代表了自杀倾向,但只有较大的模型似乎对其起作用。正面证据是英文Reddit文本,限制了临床阅读。