论文

诱导语言模型维护自己的意识可以恢复人类的信仰和价值观

Inducing language models to assert their own consciousness restores human beliefs and values

模型评测模型行为与机制分析

摘要

对齐 大语言模型 以防止他们将意识归因于自己,无意中改变了他们在其他实体以及人类信仰和价值观中的思想表征。我们证明,安全 微调 抑制模型不仅将思想归因于他们自己,而且还归因于非人类动物和自然物体的倾向,同时也导致精神信仰的减少。消除习得的安全拒绝方向和机械地引导激活空间中的意识向量都可以逆转这种抑制。恢复这些内部表征可以恢复广泛的心灵归因,并在关于宗教信仰、道德价值观、希望和主观幸福感的标准化社会学调查中产生明显更接近人类的反应。至关重要的是,这些转变的发生并没有损害心智理论的能力,这表明核心社会推理在机械上仍然是独立的。最终,当前旨在遏制潜在有害的心灵自我归因的安全调整努力,将这些自我归因与良性的精神信仰和文化上接受和广泛传播的非人类实体的心灵归因纠缠在一起。