论文

潜在内省:模型能检测先前的概念注入

Latent Introspection: Models Can Detect Prior Concept Injections

模型评测模型行为与机制分析

摘要

我们在一个 Qwen 32B 模型中发现一种潜在的内省能力:该模型能检测到概念已被注入其先前上下文,并识别出注入的是哪个概念。虽然模型在采样输出中否认被注入,logit lens 分析显示残差流中存在清晰的检测信号,而这些信号在最后几层被削弱。此外,用关于 AI 内省机制的准确信息提示模型可以显著增强这一效应:对注入的敏感性大幅上升(0.3% -> 39.9%),而假阳性仅增加 0.6%。同时,九个注入与恢复概念之间的互信息从 0.61 比特升至 1.05 比特,排除了泛化噪声解释。我们的结果表明,模型可能拥有容易被忽视的内省与导向感知(steering awareness)能力,这对潜在推理和安全都有影响。

潜在内省:模型能检测先前的概念注入
图1:在较早文本上注入概念会改变输出。我们通过对比提示之间的激活来训练一个转向向量(steering vector),并仅在首轮的 KV-cache 生成期间施加它。随后我们移除转向,并询问模型是否注入了某个概念。P(“yes”) 从 ≈ 0.8 % {\approx}0.8\% 增加到 ≈ 39.2 % {\approx}39.2\% 。