论文
超越静态几何的潜意识提示:因果深度和多标记混淆
Subliminal Prompting Beyond Static Geometry: Causal Depth and Multi-Token Confounds
摘要
潜意识学习表明,语言模型可以通过看似与之无关的输出来传递隐藏的特征。一种提出的解释是词元纠缠,它通过模型的输出词汇将动物和数字词元联系起来。然而,现有的测量回答了不同的问题:输出是否共变、固定输出向量是否对齐、可以从隐藏状态读取答案,或者该状态因果地控制答案。我们在固定的动物数量提示方案中单独测量每一个。从 Llama-3.1-8B 到 70B,固定输出向量相似度预测行为的效果较差:配对平均相关性变化为 -0.080(95% CI [-0.127,-0.035])。固定输出头读数显示归一化深度 AUC 没有已解决的变化。为了测试控制,我们将临时答案位置状态从一个数字提示复制到另一个数字提示的五个深度,并测量最终动物得分遵循哪个提示。供体对照 AUC 从 0.254 上升至 0.540,配对变化为 +0.286(95% CI [+0.272,+0.300]),所有 18 个概念均有所增加。对比仍然存在,仅剩下八个Transformer块,而特异性和身份控制仍然很小或精确。在两个 Qwen 模型中,按顺序对每个数字进行评分并不能恢复正的单标记关联。相反,每个词元的平均会创建一个正的池关联,该关联在控制数字宽度后消失,从而揭示了长度混淆。因此,固定的几何形状、观察的可读性、因果时序和多标记测量是这个冻结的提示通道的独特属性。它们限制了词元级别的解释,但没有确定训练时特征转移的机制。