论文

SafeEvo:解析与更新语言模型的安全对齐电路

SafeEvo: Deciphering the Safety Alignment Mechanism and Evolution in Language Models

模型评测模型训练监督微调与指令调优模型行为与机制分析安全与风险评测

摘要

安全可解释性推进了大语言模型 (LLM) 的研究,从数据或算法驱动的行为约束转向更深入地理解内部机制。然而,现有的工作主要集中在与安全相关的表示、注意力头或对齐后的神经元上,而很大程度上忽略了仅预训练模型中的安全机制及其跨对齐检查点的演变。为了解决这个问题,我们提出了 SafeEvo,这是一个从电路(LLM 的稀疏子图)角度来看的可解释性框架。 SafeEvo 首先应用基于优化的提取算法来识别预训练的基础 LLM 中可以独立表达拒绝行为的弱拒绝电路。因果地消除这些电路完全消除了基本模型对有害输入的拒绝。然后,SafeEvo 追踪拒绝电路在连续对齐检查点上的演变,发现它们的结构逐渐变化,这表明对齐税可能是由于拒绝电路更新影响效用相关参数而产生的。为了验证这一点,SafeEvo 引入了安全电路对齐 (SCA),它将安全更新限制在拒绝电路中。三个 LLM 和两种对齐算法的实验表明,平均而言,SCA 在三个方面优于普通对齐: \textbf{(1) 更强的对齐},将危害性分数降低了 63.21\%; \textbf{(2) 减少过度拒绝},良性查询的拒绝率降低了 58.44%;和\textbf{(3)更好的效用},保留了99.58%的原始模型能力。

SafeEvo:解析与更新语言模型的安全对齐电路:论文原图
图 2:我们的安全电路对齐算法概述。它首先在 LLM 对齐之前提取拒绝电路(步骤 A),并且仅微调该电路中已识别的参数以实现精确对齐(步骤 B)。