论文

完美的检测,失败的控制:语言模型中认知与引导的几何关系

Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models

模型评测模型行为与机制分析

摘要

机械可解释性的核心愿望是可控性:如果我们知道模型激活中行为的体现,我们应该能够修改它。这基于一个隐藏的前提——检测行为的方向和控制行为的方向是相同的,或者接近的。我们从几何角度对此进行测试:最能检测行为的方向与最能导致行为的方向之间的角度是多少?如果检测意味着控制,则余弦接近 1;否则它会量化检测与干预之间的差距。在 Gemma 2-2B-it 上,输出格式(干净的 JSON 与 Markdown fencing)将两个角色折叠到一个轴上。幻觉则不然:模型以完美的线性可分离性(从第 5 层开始,AUC = 1.000)检测虚假实体,但该方向与产生拒绝的方向的 cos = 0.12(约 83 度)——一个小的、可重复的对齐,远离“检测即控制”所需的 cos = 1。由激活构建的检测器,没有选择标记,同样无法对齐(cos = -0.06)。这种差距是普遍存在的:在来自三个系列和两个尺度(1B-9B)的四个模型中,cos 保持在 [0.12, 0.20],指令调整前后相同(0.1197 vs 0.1200),将其起源于预训练。向拒绝方向旋转 15 度部分弥补了这一问题——两个保留的虚假实体类别的拒绝率分别为 73% 和 60%,误报率为 1.8%。然后我们问这个余弦是否可以预测可操纵性,但事实并非如此:检测是一个高维类,而不是单一方向,区分可操纵情况的因素是功能性的,而不是从静态角度可读的。余弦是认知和转向之间分离的可权重计算的签名,而不是它的预测因子。