论文

SafeSeek:语言模型中安全电路的通用属性

SafeSeek: Universal Attribution of Safety Circuits in Language Models

模型评测模型行为与机制分析

摘要

机械可解释性揭示了 大语言模型 (LLM) 中的安全关键行为(例如,对齐、越狱、后门)基于专门的功能组件。然而,现有的安全归因方法由于依赖启发式、特定领域的指标和搜索算法,因此在泛化性和可靠性方面存在困难。为了解决这个问题,我们提出了一种统一的安全可解释框架,它通过优化来识别 LLM 中功能完整的安全电路。与专注于孤立头部或神经元的方法不同,我们的方法引入了可微分的二进制掩模,通过安全数据集上的梯度下降来提取多粒度电路,同时集成了安全电路调整以利用这些稀疏电路来实现高效的安全性 微调。我们在 LLM 安全性的两个关键场景中验证了我们的方法:\textbf{(1) 后门攻击},识别稀疏度为 0.42\% 的后门电路,其消融将攻击成功率 (ASR) 从 100\% $\ 消除到 $ 0.4\%,同时保留超过 99\% 的通用效用; \textbf{(2) 安全对齐},定位具有 3.03\% 头和 0.79\% 神经元的对齐电路,其去除将 ASR 从 0.8\% $\ 飙升至 $ 96.9\%,而在有用期间排除此电路 微调 保持 96.5\% 安全保留。