论文
潜在内省:模型能检测先前的概念注入
Latent Introspection: Models Can Detect Prior Concept Injections
摘要
我们在一个 Qwen 32B 模型中发现一种潜在的内省能力:该模型能检测到概念已被注入其先前上下文,并识别出注入的是哪个概念。虽然模型在采样输出中否认被注入,logit lens 分析显示残差流中存在清晰的检测信号,而这些信号在最后几层被削弱。此外,用关于 AI 内省机制的准确信息提示模型可以显著增强这一效应:对注入的敏感性大幅上升(0.3% -> 39.9%),而假阳性仅增加 0.6%。同时,九个注入与恢复概念之间的互信息从 0.61 比特升至 1.05 比特,排除了泛化噪声解释。我们的结果表明,模型可能拥有容易被忽视的内省与导向感知(steering awareness)能力,这对潜在推理和安全都有影响。
