论文
从内部机制识别模型内省
Identifying Introspection From the Inside
摘要
大语言模型对自己的声明既重要又越来越难以仅通过行为来验证。我们如何区分似是而非的虚构和真正的内省?在本文中,我们在受控环境中识别了忠实自我报告的机制特征。使用低秩适配器,我们训练模型根据潜在线性偏好函数代表虚构角色做出决策。我们发现,即使没有明确的自我报告监督,在隐式决策任务上持续的微调也可以导致模型学习偏好的准确自我报告的出现。我们针对这一新兴现象提出了两个研究问题。第一:准确的自我报告的出现是否伴随着模型中可测量的结构变化?权重 消融 和冻结层实验共同表明,偏好表示转移到训练的更早层,这与忠实的自我报告要求偏好位于预先存在的语言机制可以访问的位置的假设一致。第二:这些结构差异能否区分忠实模型和不忠实模型?使用归因修补,我们发现忠实模型在决策和自我报告任务之间表现出明显更高的归因相似性——这是忠实自我报告的机械特征,不需要我们理解报告本身的内容。之前关于自我报告的研究已经从行为上观察到模型可以是忠实的,也可以是不忠实的。我们的工作表明,至少在我们的限制环境中,可以通过检查网络本身的结构来区分两种计算模式。
