论文

局部稀疏性实现无监督 LLM 安全检测

Local Sparsity Enables Unsupervised LLM Safety Detection

AI 基础设施AI安全与内容治理基础设施

摘要

大型语言模型 (LLM) 的部署时安全方法主要受到监督,并假设可以访问不安全的训练数据。然而,新的攻击和伤害类别经常出现,而没有被以这种监督方式训练的模型捕获。另一种方法是通过异常检测的视角来看待这个问题,即仅依赖于对安全数据进行建模并标记分布外的输入。然而,LLM 激活位于高维空间,引发了人们对异常检测在统计上是否可行的担忧。我们证明,在线性表示假设(LRH)下,可能确实有希望。在通常通过稀疏自动编码器 (SAE) 恢复的 LRH 概念空间中,附近的点共享一个小的公共主动支持。利用这种局部稀疏性洞察力,我们提出了一个基于局部屏蔽的 SAE 异常检测的框架,并得到理论论证的支持。我们在各种架构和数据集上对其进行验证,包括能力测试数据集和特定于安全的数据集。最后,当我们允许算法使用 1% 的分布外数据进行校准时,局部稀疏方法实现了接近最优的性能,证明了它们在仅使用 1-2% 的 SAE 神经元进行计算的情况下捕获有意义的安全信息的能力。