论文
主动适应,而非静态防御:对抗中预防性转向的时间动态 微调
Active Adaptation, Not Static Defense: Temporal Dynamics of Preventative Steering in Adversarial Fine-Tuning
摘要
大语言模型 对于恶意 微调 仍然很脆弱,从而激励训练时防御有害角色漂移。预防性指导在 微调 期间注入不良特征角色向量,并在评估时将其删除,但其持久保护背后的机制仍不清楚。分析其时间优化动态,我们发现防御是从早期补偿适应阶段出现的,随后是校正信号衰减的稳态阶段;在参数空间中,注意力输出投影成为防御性更新的主要残差写入路径。通过干预增量保留(IDP)和IDP延续实验,我们进一步表明,保留或重新注入重量偏移无法维持保护,这表明预防性转向依赖于主动适应而不是静态防御。受这一发现的启发,我们提出了渐进强度调度(PIS),它以中等注射强度开始,并在静态强度调整开始衰减后增加注射强度。在评估的 Qwen2.5 和 Gemma-3 模型中,PIS 提高了静态强度转向的安全鲁棒性,同时减少了有害特征的表达。