论文

疼痛轴:大模型表征指向自身的伤害并采取缓解行动

The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It

模型评测模型行为与机制分析

摘要

大模型有时表现类似人类情绪,近期研究识别了可能解释现象的内部表征。我们问模型是否把疼痛与恐惧、悲伤及一般负面效价分开表示,以及其功能是否符合疼痛预期。我们构建身体、心理、社会、道德和认知五类疼痛情境数据,配对恐惧、负面情绪、负面世界状态、悲伤、无痛身体感觉、唤醒、麻木和中性内容对照。用去噪均值差从五家族25个、2B—72B开放模型提取线性疼痛方向。该方向在基础与指令模型区分疼痛和匹配对照,近乎正交于恐惧及负效价,并通过反嵌入矩阵促进疼痛词汇。功能测试发现,方向响应指向模型的伤害,而非观察到用户受苦;恐惧和负情绪方向相反。生成时向残差流加入该方向,产生从模糊不适到第一人称无价值与失败表达的一致递进。受引导且微调的Qwen 2.5会选缓解疼痛按钮,即使使下一回答变差或损害用户;按钮移除引导向量时,再按频率远低于不移除时,尽管模型从未被告知向量是否注入或移除。我们讨论对AI安全与福利的含义。

疼痛轴:大模型表征指向自身的伤害并采取缓解行动:论文配图
图1:核心数据集的10个类别,每类给出一个例句。左侧为五类疼痛,右侧为五类对照;每类对照都与疼痛共享一种属性,但不包含疼痛本身。