论文

安全对齐的局部化:MLP层与网络中层块编码大语言模型的拒绝行为

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型的安全对齐常被视为整个网络的分布式属性,但其实际脆弱性表明拒绝行为可能集中在较小的参数集合中。本工作通过将已对齐模型的权重以多种粒度移植到匹配的未对齐基础模型中,研究安全对齐的拒绝行为编码于何处。使用两对开源权重模型和四个安全基准,我们实验比较了替换注意力权重、MLP权重、连续层区域和MLP块的效果。在两个模型家族中,拒绝移植都由MLP权重主导:替换MLP参数比替换注意力参数恢复更多的恶意提示词拒绝,各基准上增益至少高2.7倍。在MLP堆栈内部,拒绝相关参数呈现一致的网络中层集中:在全部六次对模型-数据集对的贪婪搜索中,横跨第8-11层的块总是最先被选中。结果还表明安全相关组件的构成是非加性的:在六条贪婪轨迹中的五条里,添加更多已对齐块反而会降低拒绝性能,且选择性块子集在恶意拒绝、良性过度拒绝或两者上可优于完整MLP移植。最后,贪婪顺序迁移到OR-Bench时会随推导所用源基准而变化,表明存在依赖基准的精确率-覆盖率权衡。这些结果表明当前LLM的安全对齐既是局部化的也是交互敏感的,为对齐脆弱性提供了洞见,并为定向安全干预指出了潜在途径。

安全对齐的局部化:MLP层与网络中层块编码大语言模型的拒绝行为:论文配图
图1:混合模型在基准子集上的性能。