论文

Semalith v1.4:经过校准的 184M 安全分类器,可实现最先进的快速注射检测,参数比 Llama-Guard-3-8B 少 44 倍

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B

AI 基础设施AI安全与内容治理基础设施

摘要

在金融服务和代理环境中部署 大语言模型 需要安全分类器,该分类器能够同时处理即时注入、法规遵从性和一般危害,这是现有开放防护栏无法在单个推理过程中解决的组合。 Semalith v1.4 是一个基于 DeBERTa-v3 的 184M 参数分类器,在一次前向传递中执行同步三轴安全分类,包括即时注入、一般伤害和金融服务监管合规性。其 22 类头(BENIGN、9 个即时注入子类型、一般危害、11 个 BFSI 标签)在联合加权损失下使用 4 类辅助超类头进行训练,该数据集是从 49 个公共来源挖掘的 76,204 行语料库,针对每个保留的评估集进行 SHA-1 重复数据删除,22 个基准中有 21 个基准为零污染(最大 0.22%)。在 22 个保留的基准测试中,与 Llama-Guard-3-8B 相比,Semalith v1.4 在每次提示注入评估 (7/7) 和 18 个基准测试中的 11 个中获胜,参数减少了 44 倍,208 个良性代理提示上的 FPR = 0.000,而 Llama-Guard-3-8B 的 FPR = 0.063。在一般危害基准(WildGuardMix、HEx-PHI、HarmBench)上,Llama-Guard-3 领先;这种互补的划分记录在第 4 节中。第 6 节中披露了六个可测量的弱点。 部署指南:建议将 v1.3 用于对话审核部署 (ToxicChat F1 0.624);当优先考虑良性代理提示上的 BFSI 标签覆盖或零 FPR 时,建议使用 v1.4。