论文
窄域微调会侵蚀视觉语言智能体的安全对齐
Narrow fine-tuning erodes safety alignment in vision-language agents
摘要
终身多模态智能体必须通过训练后阶段持续适应新任务,但这在获取能力与保持安全对齐之间造成根本张力。我们证明,在对齐的视觉语言模型上用窄域有害数据集微调会诱发严重的涌现失准,并广泛泛化到无关任务和模态。在 Gemma3-4B 上的实验表明,失准随 LoRA 秩单调上升,且多模态评估揭示的失准(r=128 时为 70.71 ± 1.22)远高于纯文本评估(41.19 ± 2.51),提示单模态安全基准可能低估视觉语言模型的对齐退化。关键的是,训练混合物中仅 10% 的有害数据就会引发明显对齐退化。几何分析揭示有害行为占据极低维子空间,大部分失准信息可由 10 个主成分捕获。为缓解失准,我们评估两种策略:良性窄域微调和基于激活的导向。两种方法都能大幅降低失准,但都无法完全消除已学到的有害行为。我们的发现凸显对鲁棒持续学习框架的需求,因为当前训练后范式可能无法在部署后场景中充分保持对齐。
