论文

分析语言模型中的自我伤害表征:跨架构研究

Analysing Self-Harm Representations in Language Models: a Cross-Architecture Study

模型评测模型行为与机制分析

摘要

使用 NLP 技术检测自残内容尤其具有挑战性,而且也是一项高风险的任务,需要最高的准确性才能及时干预或标记有风险的用户。因此,我们对 LLM 如何表示此类自残内容进行了分析,该内容在自残检测、LLM 干预以及治理和警务方面具有下游应用。在本文中,我们关注两个数据集和四个模型,并进行两个主要实验:(1)我们在两个自残数据集:X-Sensitive 和 SH-Detection 上训练和评估每个模型所有层的线性探针。在这两个语料库中,自残信息在最后 3 - 7% 的网络层(93% 至 97% 深度)中具体化。 (2)我们提取对比的自残方向,并在执行归一化步骤后,我们发现最准确的探针不一定是最线性可分离的。特别是,我们发现 Gemma-3-4B 以一种与其他 LLM 略有不同、更复杂的方式来表示这种 \textit{对比自残方向}。