论文

由内而外的LLM安全:利用内部表示检测有害内容

LLM Safety From Within: Detecting Harmful Content with Internal Representations

模型评测安全与风险评测

摘要

守卫模型(guard model)被广泛用于检测用户提示和LLM响应中的有害内容。然而,最先进的守卫模型仅依赖末端层表示,忽视了分布在内部各层中丰富的安全相关特征。我们提出SIREN,一个利用这些内部特征的轻量级守卫模型。SIREN通过线性探测识别安全神经元,并通过自适应层级加权策略将其组合,在不修改底层模型的情况下从LLM内部构建有害性检测器。我们的全面评估表明,SIREN在多个基准上大幅超越最先进的开源守卫模型,同时可训练参数减少250倍。此外,SIREN对未见过的基准表现出更强的泛化能力,天然支持实时流式检测,并且与生成式守卫模型相比显著提升推理效率。总体而言,我们的结果凸显了LLM内部状态作为实用、高性能有害性检测基础的前景。

由内而外的LLM安全:利用内部表示检测有害内容:论文配图
图 2:跨基准的精确召回分析,包括提示级别和响应级别的有害检测。 SIREN(星星)在所有数据集的对角线附近保持平衡的精度和召回率,而防护模型(圆圈)在策略一致性方面表现出更大的差异。