论文

拒绝的几何学:为什么事后安全性脆弱而预训练时安全性仍然存在

The Geometry of Refusal: Why Post-Hoc Safety Is Fragile and Pretraining-Time Safety Persists

模型评测模型行为与机制分析

摘要

事后安全训练(RLHF、DPO)是对齐 大语言模型 的主要方式,但越狱(Zou 等人,2023b)、微调 攻击(Qi 等人,2024)和激活空间探测器(Arditi 等人,2024)不断恢复其本来要消除的行为。我们对这种脆弱性给出了一种几何解释,并追踪到在预训练期间安全性何时能够发挥作用。我们根据模型能力的曲率(能力损失的经验 Fisher)来测量安全更新 $Δ= W_{\text{safe}} - W_{\text{base}}$。事后安全始终处于抑制状态:$Δ$ 几乎与能力方向正交,并且其较小的子空间部分集中在一些高曲率部分。这次更新虽然薄弱但尖锐,是对完整功能设置了拒绝门,而不是删除它们。内核固定性引理解释了为什么这样的更新只能屏蔽功能,而不能删除它,所以一点良性的 微调 可以恢复它:Qwen-2.5-7B 和 Llama-3-8B 上的 100 个良性 微调 拒绝崩溃步骤指示保留的功能,这是在五个模型系列中复制的签名。考虑到预训练后,OLMo-2-1B(OLMo 等人,2025)的 267 个检查点扫描显示了安全参与在大约 6B 和 60B 预训练词元之间急剧转变中出现的基础。然后,我们建设性地使用该帐户:从头开始训练并进行安全协同训练的模型在预训练中不断传播,拒绝率达到 87% 到 98%,其攻击后水平在每个规模上都保持在 84% 到 91%,事后安装的 35 到 38 pp 下降了 2 到 14 pp,能力匹配或优于仅 LM 基线,并保持在 410M 到 6.9B,而计算匹配的窗口计划不会造成持久的拒绝。安全信号在预训练过程中的持久性,而不是其时间安排,才是攻击稳健性的关键。