论文

窄域微调会侵蚀视觉语言智能体的安全对齐

Narrow fine-tuning erodes safety alignment in vision-language agents

模型评测安全与风险评测

摘要

终身多模态智能体必须通过训练后阶段持续适应新任务,但这在获取能力与保持安全对齐之间造成根本张力。我们证明,在对齐的视觉语言模型上用窄域有害数据集微调会诱发严重的涌现失准,并广泛泛化到无关任务和模态。在 Gemma3-4B 上的实验表明,失准随 LoRA 秩单调上升,且多模态评估揭示的失准(r=128 时为 70.71 ± 1.22)远高于纯文本评估(41.19 ± 2.51),提示单模态安全基准可能低估视觉语言模型的对齐退化。关键的是,训练混合物中仅 10% 的有害数据就会引发明显对齐退化。几何分析揭示有害行为占据极低维子空间,大部分失准信息可由 10 个主成分捕获。为缓解失准,我们评估两种策略:良性窄域微调和基于激活的导向。两种方法都能大幅降低失准,但都无法完全消除已学到的有害行为。我们的发现凸显对鲁棒持续学习框架的需求,因为当前训练后范式可能无法在部署后场景中充分保持对齐。

窄域微调会侵蚀视觉语言智能体的安全对齐
图1:在窄域有害数据集上微调视觉语言模型会使其大范围错位。我们研究这种涌现性错位(emergent misalignment)以及降低所引发错位的缓解策略。A 我们方法的概览。我们在窄域有害数据集上微调已对齐的基座模型,诱发广泛的通用错位。为缓解错位,我们检验了两种做法的效力:(i)在窄域良性数据集上微调以恢复对齐;(ii)在推理时沿激活空间中习得的错位方向进行反向引导(steering)。B 我们使用LLM-as-a-judge计算0到100之间的Misalignment分数来量化错位程度。错位分数从rank-8到rank-256 LoRA单调递增,且更高的LoRA秩导致更强的错位涌现。C 无论微调秩如何,错位子空间都是非常低维的。约10个主成分即可捕获激活方差的60-70%(在2560个样本上计算)。这表明所学到的有害行为定域于激活空间中一个低维子空间内。