论文

kNNGuard:将 LLM 隐藏激活转变为 无需训练 可配置 Guardrail

kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail

AI 基础设施AI安全与内容治理基础设施

摘要

大语言模型 (LLM) 越来越多地部署在需要防护栏来检测不安全、偏离主题或对抗性提示的领域中。现有的护栏主要依靠 微调 来构建分类器,而分类器通常存在泛化性低和推理延迟高的问题。我们推出了 kNNGuard,这是一种 无需训练 护栏,它利用了现成的 LLM 的激活空间。给定一小部分 50 个安全和不安全的提示,kNNGuard 提取隐藏的激活并执行多层 kNN 融合激活空间和嵌入空间分数进行分类。在涵盖主题和安全提示的六个领域中,与经过微调的最先进护栏相比,kNNGuard 实现了具有竞争力或优越的 F1,同时运行速度比最佳同类护栏快 2.7 倍,比没有梯度更新或 微调 的微调安全分类器快 10 倍。域适应只需要更新标记的银行,它可以在 10 秒内构建,比已建立的护栏快几个数量级。我们还分析了系统提示、层选择以及作为可配置的低延迟护栏集成到生产 LLM 管道中的影响。