论文

面向 CPU 可部署安全分类的可复现、许可感知蒸馏配方

A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification

摘要

在通用硬件上为大语言模型部署安全层,受到可用护栏(guard)模型的制约:当前的开放护栏模型参数量在 10 亿到 90 亿之间,面向 GPU 设计,在 CPU 上每个请求需要数秒才能响应。本文提出一套可复现、许可感知的知识蒸馏配方来应对这一约束。一个强力的开放护栏模型把约 97,000 条提示的语料(取自 24 个公开数据集)按公共危害分类体系标注为七个安全类别,并训练一组涵盖词法、浅层、编码器和生成式架构的小型学生模型来复现该信号。语料在许可边界处进行划分,使可部署模型与研究模型仅在训练数据上不同,从而让这一限制的代价变得可度量。每个模型都在一个 6,361 行、四个切片的独立黄金基准上打分,该基准独立于教师模型标注,并包含一个无害提示切片,使过度防御可被度量。蒸馏出的学生在对抗性文本上与教师打平(置信区间重叠),并降低无害提示上的误报:最小的生成式学生误报率为 3.8%,而 80 亿参数教师为 4.8%;编码器模型在 CPU 上每请求约 24 毫秒完成分类。按类别再平衡是该配方中唯一起决定作用的成分。我们不主张超越被蒸馏的护栏模型;在干净参考切片上教师仍然领先。