论文

GLiGuard:LLM 防护的架构条件分类

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

模型优化小模型/轻量模型

摘要

确保 大语言模型 的安全、符合策略的输出需要可以跨多个安全维度进行扩展的实时内容审核。然而,最先进的护栏模型依赖于具有 7B--27B 参数的自回归解码器,将本质上是分类问题重新表述为顺序文本生成,这种设计选择会导致高延迟,并且很难扩展到多方面评估。在这项工作中,我们引入了 \textbf{GLiGuard},这是一种改编自 GLiNER2 的 0.3B 参数模式条件双向编码器,用于 LLM 内容审核。关键思想是将任务定义和标签语义作为结构化词元模式直接编码到输入序列中,从而能够在单个非自回归前向传递中同时评估提示安全性、响应安全性、拒绝检测、14 个细粒度危害类别和 11 种越狱策略。这种模式条件设计允许在推理时直接在输入模式中组成支持的任务和标签块。在九项既定安全基准中,GLiGuard 的 F1 分数与基于 7B--27B 解码器的防护装置相比,尽管尺寸小了 23--90$\times,但吞吐量提高了 16$\times,延迟降低了 17$\times。这些结果表明,紧凑的双向编码器可以接近更大的防护模型的准确性,同时大大降低推理成本。代码和模型可在 https://github.com/fastino-ai/GLiGuard 获取。