论文
从潜空间到雅可比矩阵空间:测量、规避和训练反对安全内容可访问性
From Latent Space to Jacobian Space: Measuring, Evading, and Training Against Safety-Content Accessibility
摘要
仅输出安全监控只能看到模型计算的结束,但模型在发出答案之前会计算其答案:它内部准备说的是安全关键的。 雅可比矩阵-空间(J-空间)读出,通过模型的输入输出雅可比矩阵从隐藏状态到输出词汇的线性映射,已被提议作为行为可访问的内部内容的窗口,并且第一个安全协议(JADR)表明危险识别在那里是可读的。目前尚不清楚的是,这些可访问的内容如何与表示工程研究的潜在空间安全几何相关,以及安全训练如何塑造它。我们引入了两个定量桥梁:(i)传输放大配置文件 $A_\ell$,测量每层的雅可比矩阵向输出空间传送潜在安全方向的强度,以及(ii)配对的基础与调整协议,将可访问性归因于训练的出处。在四个小型模型对(135M 到 1.5B,三个镜头适配种子)中,经过调整的检查点将识别集中在中上层,在 0.5B DPO 时安装拒绝,而 J 空间识别则下降到随机水平:训练可以在行为安全看起来最好的地方扩大可访问性差距。部署审核关闭了循环:监控感知的 GCG 风格后缀在每个规模上都以零行为成本抑制提示端监控;只有学习过的监控梯级才能抵抗其自身的自适应重新攻击; 训练时间防御在每个惩罚重量下的重新攻击均失败;转向显示放大曲线是描述性的,而不是因果性的;当离散搜索成功时,连续前缀优化会失败。安全监控、训练和评估必须针对可访问性本身进行操作,而不能仅针对输出进行操作。