论文

动态对抗 微调 重组拒绝几何

Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

模型评测模型行为与机制分析

摘要

安全一致的语言模型必须拒绝有害请求,而不会出现广泛的过度拒绝,但目前尚不清楚动态对抗性 微调 如何改变拒绝控制载体:Kullback-Leibler (KL) 约束方向或小子空间,在没有大的安全提示分布变化的情况下因果调节拒绝。我们在监督 微调 (SFT) 和鲁棒拒绝动态防御 (R2D2) 下研究 7B 骨干网,将 HarmBench、StrongREJECT 和 XSTest 评估与五锚几何测量、因果干预和稀疏自适应压力测试相结合。 R2D2 在早期检查点将固定源 HarmBench 攻击成功率降至零;然而,这些检查点也表现出最大的 XSTest 拒绝,并且无法通过良性实用程序审核。随后的检查点部分恢复面向公用事业的行为,同时重新开启攻击成功,自适应 GCG 攻击成功率在步骤 250 上升至 0.415,在步骤 500 上升至 0.613。在内部,R2D2 通过步骤 100 保留后期层可接受的拒绝控制载波,然后将最佳可接受的载波重新定位到早期层; SFT 搬迁较早,但仍不太稳健。有效等级保持在 1.24 附近,并且 SFT 显示出更大的主角漂移,反对维度扩展和漂移幅度作为充分的解释。因果干预支持低维但效用耦合的载体。这些结果支持 R2D2 沿着鲁棒性-效用前沿的几何重组说明,而无需建立自适应鲁棒性。