论文

CoSToM:大语言模型 中内在心理理论对齐的因果导向指导

CoSToM:Causal-oriented Steering for Intrinsic Theory-of-Mind Alignment in Large Language Models

模型推理解码与生成控制

摘要

心智理论(ToM)是将心理状态归因于他人的能力,是社交智力的标志。虽然 大语言模型 (LLM) 在标准 ToM 基准测试中表现出了良好的性能,但我们观察到它们通常无法泛化到复杂的特定任务场景,严重依赖提示脚手架来模拟推理。内部知识和外部行为之间的严重错位提出了一个基本问题:LLM是否真正拥有内在认知,并且它们能否将这种内部知识外化为稳定的、高质量的行为?为了回答这个问题,我们引入了 CoSToM(ToM 对齐的因果引导),这是一个从机械解释过渡到主动干预的框架。首先,我们采用因果追踪来映射 ToM 特征的内部分布,凭经验揭示编码基本 ToM 语义的内部层特征。基于这一见解,我们通过这些 ToM 关键层中的目标激活控制来实现轻量级对齐框架。实验表明,CoSToM 显着增强了类人社交推理能力和下游对话质量。