论文
超越接口的安全检测:利用大语言模型隐状态识别有害内容
Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models
摘要
自主系统日益依赖大语言模型,但围绕这些模型建立的安全基础设施引入了延迟和计算开销,限制了其在资源受限、时间敏感部署中的实用性。现有外部防护模型无法观察模型内部运作,形成根本性的安全保证缺口。我们提出问题:模型是否已经知道内容何时有害?我们从LLaMA-3.1-8B提取激活,训练轻量级多层感知机分类探针,参数量为1260万,用于检测有害提示。在WildJailbreak、Beavertails和AEGIS 2.0上评估时,探针分别取得99%、83%和84%的F1分数,与规模大1000倍的防护模型具有竞争力,同时降低了延迟与计算成本。
