机械地引发语言模型中的潜在行为
Mechanistically Eliciting Latent Behaviors in Language Models
摘要
我们的目标是发现 LLM 内部的各种可概括的扰动,这些扰动可以揭示隐藏的行为模式。这种扰动可以帮助重塑模型行为并系统地评估潜在风险。我们引入了因果扰动诱导(CPE),这是一种无监督方法,用于发现可以引发这些潜在行为的可解释低秩适配器(LoRA)。 CPE 使用基于启发式张量分解的算法来分解深度 Transformer 切片的计算。 CPE 表现出卓越的数据效率,从单个示例中学习大量可解释的 LoRA。尽管 CPE 是无监督的,但我们发现在某些情况下它可以通过权重空间上的强力枚举搜索与有监督的启发方法竞争。例如,在 Qwen3-8B 的倒计时任务中,CPE 的表现与匹配挂钟时间的 GRPO 类似(85% vs 87%),这表明 CPE 可以有效地引发复杂的多词元行为。由于 CPE 是无人监督的,因此它还可以暴露隐藏的故障模式,例如沙袋,在 Taylor 等人推出的 Llama3-70B 密码锁定版本上恢复 85% 的锁定 BigCodeBench 性能。 (2025)。此外,由于 CPE 探索权重空间而不是词元空间中的行为,因此它可以潜在地改善探索黑客攻击,这是一种在具有充分自我意识的 AI 模型中可能出现的错位故障(Ngo,2022)。事实上,我们发现 CPE 实际上消除了 Hughes 等人开发的基于 Llama3-70B 的模型生物中的对齐伪造(Greenblatt 等人,2024)行为。 (2025)。最后,我们发现当在容易出现 奖励作弊 的环境中运行 GRPO 时,CPE 可用于在对齐的盆地中初始化 GPT-OSS-20B。通过提供一种数据有效的方法来系统地探索潜在模型行为的空间,CPE 产生了一个强大的工具来调整人工智能系统并评估其安全性。