论文
度量 大语言模型中的激活控制
Measuring Activation Control in Large Language Models
摘要
对日益强大的模型而言,安全部署可能将依赖潜空间监测作为行为评估的补充,尤其当评估感知模型表现出图谋(scheming)或欺骗行为时。然而,如果模型也能控制自己的激活,欺骗就可能延伸到潜空间本身。有鉴于此,我们提出激活可控性基准(Activation Controllability Benchmark),量化模型通过自然语言指令调节其残差流的程度。跨越模型家族和能力水平,我们发现大多数 LLM 能够以一定的时间分辨率控制其残差流激活的方向和幅度,尽管不同模型的表现差异很大。在简单任务中,这种控制水平可以(尽管不完美地)规避基于激活的监测方法,包括线性探针、自然语言自编码器、激活 oracle 和雅可比透镜。这些结果表明,随着内省能力增强,对激活空间本身的控制可能成为监测的混淆因素;因此我们建议前沿实验室和评估者在未来模型上跟踪激活可控性。
