论文
Transformer语言模型中情境建模和心智化的发展轨迹
Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models
摘要
最近的研究表明,大语言模型 (LLM) 对文本描述的主体的信念状态敏感,如通过错误信念任务 (FBT) 测量的那样,但对结构有效性的持续关注仍然存在。我们采用**发展的视角**,在 Olmo2 和 Pythia 语言模型套件的多个训练阶段中追踪心理状态推理行为的模式,以及这种行为可能的**先决条件**。我们发现,高于机会的 FBT 性能取决于模型大小和足够的训练量,在预训练中出现相对较晚,并且在最诊断心智化(错误信念、隐式)的情况下通过 后训练 干预(SFT、DPO)得到最大改善。然而,FBT 的表现很脆弱:与过去的工作一致,即使在真实信念条件下,使用非事实动词(例如,认为)也会增加错误信念归因。为了将这些发现结合起来,我们跟踪了**情境建模**的出现:报告所描述场景的基本事实属性的能力。情境建模的准确性通常先于并超过 FBT 的准确性,但情境表征在某些方面也被证明是令人惊讶的不连贯:当被问及总是知道该项目的真实位置的拮抗剂代理的知识状态时,Olmo2 13b 始终受到目标代理的知识状态和非事实动词的存在的影响。总之,这些结果表明,更大的、经过充分训练的模型以适合发展的顺序构建部分连贯的情境模型,但显示出令人惊讶的脆弱性——凸显了评估 LLM 能力的发展和压力测试方法的价值。