论文

可操纵但不可解码:函数向量在 logits 镜头之外运行

Steerable but Not Decodable: Function Vectors Operate Beyond the Logit Lens

模型评测模型行为与机制分析

摘要

激活引导预设任务相关行为对应于激活空间中的线性方向——这些方向应该既引导模型又沿着非嵌入可读。函数向量 (FV) 作为 ICL 演示中的平均差异提取,是典型的测试用例;预测:转向和解码一起成功或失败。在 12 个任务、来自 3 个系列的 6 个模型以及 4,032 个有向交叉模板对中,我们发现了相反的情况。当 logits 镜头无法在任何中间层解码正确答案时,FV 转向通常会成功,而相反的情况(可解码而不可转向)几乎是空的(72 中的 3)。差距不是代表性的方言。对角调谐镜头关闭了 14 个可操纵但不可解码的情况之一;具有 Hewitt \& Liang 控制的 2 层 MLP 探针通过非线性编码结构关闭 10 个中的 5 个,但留下 5 个对每个测试的解码器不可见。即使转向精度超过 0.90,通过非嵌入来投影 FV 也会产生不连贯的词元分布:FV 编码计算指令,而不是回答方向。模型族的不对称性使画面更加清晰。 Mistral FV 重写中间表示,而 Llama 和 Gemma FV 引导最终输出,而不会留下 logits 镜头可见轨迹,并由三个信号(引导后增量、激活修补恢复、FV 范数传输相关性)证实。先前报道的负余弦传递相关性大规模消失,最多在任务标识之外增加 $ΔR^2 = 0.011$。这些结果将线性表示假设分解为线性可解码性和线性可操纵性,并表明它们与直觉相反,对安全监控具有影响:词汇投影工具对广泛部署的模型系列的 FV 式干预视而不见。