论文
在 AI 内省中将直接访问与推理分离
Dissociating Direct Access from Inference in AI Introspection
摘要
内省是一种基本的认知能力,但其机制尚不清楚。最近的研究表明人工智能模型可以进行内省。我们研究他们的内省机制,首先广泛复制 Lindsey 等人的方法。 (2025)大型开源模型中的思想注入检测范例。我们表明,这些模型通过两种可分离的机制检测注入的表示:(i)概率匹配(从提示的感知异常中推断)和(ii)直接访问内部状态。直接访问机制与内容无关:模型检测到发生了异常,但无法可靠地识别其语义内容。我们研究的两个模型类虚构了高频且具体的注入概念(例如“苹果”);对于他们来说,正确的概念猜测通常需要更多的标记。这种与内容无关的内省机制与哲学和心理学的主导理论是一致的。
