论文

HARC:耦合有害性与拒绝方向实现鲁棒安全对齐

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

模型训练监督微调与指令调优

摘要

理解对齐LLM如何在内部表示安全对诊断对齐漏洞至关重要——它解释越狱为何成功——并为稳健对齐策略的设计提供信息。先前工作表明对齐LLM在提示侧token位置将有害性与拒答编码为残差流中可分离的方向。我们表明越狱在提示编码阶段即告成功——通过在任何token生成前抑制拒答方向或有害性方向——不同攻击类别占据有害性-拒答平面的可分离区域。将分析扩展到响应token位置——我们发现模型在生成有害内容的同时即识别该内容有害——即使它在提示侧未能将输入识别为有害。受这些发现启发——我们引入HARC(有害性与拒答耦合)——在提示与响应两个位置配对这两个方向的微调方法。由于干预局限于有害性-拒答子空间——它保持残差流其余部分完好——不降低通用能力也不加剧过度拒答。跨大量实验——HARC在覆盖主流训练时与推理时安全方法的六个基线中取得最强的鲁棒性-能力-可用性权衡。我们在五个模型家族与两个规模上测试的提示与响应位置的有害性与拒答方向无需架构特定调优即可迁移。

HARC:耦合有害性与拒绝方向实现鲁棒安全对齐:论文配图
图 8:四方向结构在五个指令调整模型系列中复制。每个模型所选层的成对余弦相似度(等式 6)。响应端解耦 (vharmresp↔vrefrespv^{\mathrm{resp}}_{\mathrm{harm}}\leftrightarrow v^{\mathrm{resp}}_{\mathrm{ref}}) 和相同概念交叉位置对齐 (vharm↔vharmrespv_{\mathrm{harm}}\leftrightarrow v^{\mathrm{resp}}_{\mathrm{harm}} 和 vref↔vrefrespv_{\mathrm{ref}}\leftrightarrow v^{\mathrm{resp}}_{\mathrm{ref}}) 跨架构一致地复制。不同家族的即时侧解耦有所不同,其中 Llama 和 Gemma 表现出最干净的分离,而 Mistral 和 Qwen 则表现出更加纠缠的即时侧方向。