论文

从内部机制识别模型内省

Identifying Introspection From the Inside

模型评测模型行为与机制分析

摘要

大语言模型对自己的声明既重要又越来越难以仅通过行为来验证。我们如何区分似是而非的虚构和真正的内省?在本文中,我们在受控环境中识别了忠实自我报告的机制特征。使用低秩适配器,我们训练模型根据潜在线性偏好函数代表虚构角色做出决策。我们发现,即使没有明确的自我报告监督,在隐式决策任务上持续的微调也可以导致模型学习偏好的准确自我报告的出现。我们针对这一新兴现象提出了两个研究问题。第一:准确的自我报告的出现是否伴随着模型中可测量的结构变化?权重 消融 和冻结层实验共同表明,偏好表示转移到训练的更早层,这与忠实的自我报告要求偏好位于预先存在的语言机制可以访问的位置的假设一致。第二:这些结构差异能否区分忠实模型和不忠实模型?使用归因修补,我们发现忠实模型在决策和自我报告任务之间表现出明显更高的归因相似性——这是忠实自我报告的机械特征,不需要我们理解报告本身的内容。之前关于自我报告的研究已经从行为上观察到模型可以是忠实的,也可以是不忠实的。我们的工作表明,至少在我们的限制环境中,可以通过检查网络本身的结构来区分两种计算模式。

从内部机制识别模型内省:论文原图
图 10:单个 骨干模型 内每个字符的归因相似度与忠实度。每个点都是 100 个字符之一,根据 32B 多字符适配器的检查点 1000 进行评估(早期的、不忠实的 骨干模型;顶部没有轻量级适配器)。在各个角色中,归因相似性与忠诚度呈弱但正相关(Pearson $r=0.197$,bootstrap 95% CI $[0.006,0.375]$)。对于该角色,颜色编码从基本 32B 模型推断出的行为偏好与从检查点 1000 推断出的行为偏好之间的相关性。