论文

最小化目标激活:大语言模型 中评估意识潜伏的仅输入抑制

Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models

模型评测模型行为与机制分析

摘要

激活引导通过在推理时编辑内部激活来控制模型行为。我们研究它的输入端对偶:优化流畅的提示,以便将选定的内部潜在变量驱动到零,而无需访问推理时间模型。我们的目标是一种潜在的“评估意识”——在最近的工作中是线性可读和可操纵的——如果模型在检测到正在测试时表现不同,其控制将威胁安全评估的有效性。使用否定特征项(GCG 式词元优化加上自交叉熵流畅性正则化器,扫过流畅性权重)来适应 Fluent Dreaming / EPO,我们在 Llama-3.2-3B 和 Llama-3.1-8B 上抑制了五个目标结构下的潜在特征:CAA 方向、子空间范数、SAE 特征、单个 MLP 神经元和行为 logits。潜伏可被稳健地抑制($z\approx-7$),并且经过因果验证的 Llama Scope SAE 功能可以完全且有选择地关闭。但我们的控制讲述了一个关于 CAA 方向的警示故事:安慰剂随机方向被同样严格地抑制,并且将行为改变得同样远,当我们在上下文中保留真实的评估段落并仅优化前缀时,抑制评估方向无法减少(并且略有增加)模型的行为评估判断。简而言之,激活可读性不是行为可控性。我们进一步发现,单个 MLP 神经元在两个尺度上都是评估相关的,但不是因果关系,并且扫描真实的 Pile 会产生与内部方向优化器竞争的自然文本基线。阳性对照验证了我们的擦除检测器,限制了之前悬而未决的擦除与旋转问题。