论文

在 AI 内省中将直接访问与推理分离

Dissociating Direct Access from Inference in AI Introspection

模型评测模型行为与机制分析

摘要

内省是一种基本的认知能力,但其机制尚不清楚。最近的研究表明人工智能模型可以进行内省。我们研究他们的内省机制,首先广泛复制 Lindsey 等人的方法。 (2025)大型开源模型中的思想注入检测范例。我们表明,这些模型通过两种可分离的机制检测注入的表示:(i)概率匹配(从提示的感知异常中推断)和(ii)直接访问内部状态。直接访问机制与内容无关:模型检测到发生了异常,但无法可靠地识别其语义内容。我们研究的两个模型类虚构了高频且具体的注入概念(例如“苹果”);对于他们来说,正确的概念猜测通常需要更多的标记。这种与内容无关的内省机制与哲学和心理学的主导理论是一致的。

AI中涌现的内省是与内容无关的
图1:我们的主要实验。左,实验1。上,第一人称:被转向的模型能检测到注入,但在识别上产生虚谈(confabulate);两者都将“apple”列为第1位错误猜测。下,第三人称:被转向的模型(观察到前述对话的圆形机器人)报告另一个模型(方形头机器人)是否被注入了想法。右,实验2 上,第一人称启动:启动有助于识别但无助于检测。下,第三人称启动:未转向的对照报告检测到注入;转向可以降低检测。