论文

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性

Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization

模型训练监督微调与指令调优

摘要

大语言模型(LLM)的安全对齐旨在减少有害或不安全行为,同时保持通用能力。然而近期研究发现对齐效果可能很脆弱:轻量的对齐后操纵,如参数噪声、激活噪声或量化,就能轻易削弱预期的安全行为。此前提升鲁棒性的努力主要集中在数据整理、修改对齐目标与识别安全关键参数上,而优化器本身的作用基本未被探索。本文首次从基础优化器的视角研究安全对齐的鲁棒性。这种以优化器为中心的视角自然指向零阶优化,它通过在扰动下评估安全对齐来提供面向鲁棒性的信号。基于这一洞见,我们提出一个混合框架:先执行标准的一阶安全对齐,再应用零阶精调以提升鲁棒性。我们从理论和实证两方面证明,仅需少量零阶精调步骤即可在保持安全对齐的同时增强鲁棒性。我们进一步利用零阶精调固有的基于扰动的评估来估计逐层鲁棒性敏感度,使精调过程将更新集中在鲁棒性关键层上,从而以适度的训练开销提升效率。

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性:论文配图
图 1:我们以稳健性为导向的安全调整框架概述。我们首先证明,简单的对齐后扰动可以显着提高安全对齐的LLM中的 ASR。然后,我们在 FO 安全对齐后应用 ZO 细化,并通过逐层敏感度评分确定目标鲁棒性关键层,以更有效地提高鲁棒性。