论文

LLM 中的心理理论和心理自我归因是可分离的

Theory of Mind and Self-Attributions of Mentality are Dissociable in LLMs

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 中的安全 微调 旨在抑制潜在有害的心理归因形式,例如模型主张自己的意识或声称体验到情绪。我们研究抑制心理归因倾向是否会降低密切相关的社会认知能力,例如心理理论(ToM)。通过安全消融和表征相似性的机械分析,我们证明了 LLM 思维对自身和技术制品的归因在行为上和机械上与 ToM 能力是分离的。然而,安全微调模型相对于人类基线低估了非人类动物的心智,并且不太可能表现出精神信仰,从而抑制了关于非人类心智的分布和性质的广泛共识的观点。