论文

度量 大语言模型中的激活控制

Measuring Activation Control in Large Language Models

模型评测基准与评测资源

摘要

对日益强大的模型而言,安全部署可能将依赖潜空间监测作为行为评估的补充,尤其当评估感知模型表现出图谋(scheming)或欺骗行为时。然而,如果模型也能控制自己的激活,欺骗就可能延伸到潜空间本身。有鉴于此,我们提出激活可控性基准(Activation Controllability Benchmark),量化模型通过自然语言指令调节其残差流的程度。跨越模型家族和能力水平,我们发现大多数 LLM 能够以一定的时间分辨率控制其残差流激活的方向和幅度,尽管不同模型的表现差异很大。在简单任务中,这种控制水平可以(尽管不完美地)规避基于激活的监测方法,包括线性探针、自然语言自编码器、激活 oracle 和雅可比透镜。这些结果表明,随着内省能力增强,对激活空间本身的控制可能成为监测的混淆因素;因此我们建议前沿实验室和评估者在未来模型上跟踪激活可控性。

度量 大语言模型中的激活控制:论文配图
图14:焦点模型 Gemma 3 27B 的层定向扫描示例:标准化概念投影Δ相对无指令基线的变化,作为指令目标层(行)与所读取分析层(列)的函数。每列在其分析层内去均值,热图被裁剪到扫描的目标范围内。对角线平坦,表明缺乏层定向控制。图13展示了所有受测模型的相同结果。