DP-OPD:语言模型的差分私有 同策略 蒸馏
DP-OPD: Differentially Private On-Policy Distillation for Language Models
摘要
大语言模型 (LLM) 越来越适应包含敏感信息的专有和特定领域的语料库,从而在正式的隐私保证和通过模型压缩进行的高效部署之间产生了紧张关系。差分隐私 (DP) 通常通过 DP-SGD 强制执行,可提供单条数据记录层面的保护,但在自回归生成中通常会带来巨大的效用损失,其中优化噪声会放大暴露偏差并在长期部署过程中加剧错误。现有的私有 蒸馏 方法要么将 DP-SGD 应用于教师和学生,从而恶化计算和隐私-效用权衡,要么依赖受过 DP 训练的教师进行 DP 合成文本生成,避免对学生进行 DP,代价是 DP 优化大型教师并引入离线生成管道。我们提出 \textbf{Differentially Private 同策略 蒸馏 (DP-OPD)},这是一种无需综合的框架,仅通过 DP-SGD 对学生强制执行隐私,同时利用冻结的教师在 \emph{学生生成} 的轨迹上提供密集的 词元级 目标。 DP-OPD 通过延续标记上的 \emph{private Generalized 知识蒸馏} 实例化了这个想法。在严格的隐私预算($\varepsilon=2.0$)下,DP-OPD 改善了 DP 微调 和 离策略 DP 蒸馏 的困惑度,并且优于基于综合的 DP 蒸馏 (Yelp: 44.15$\rightarrow$41.68; BigPatent: 32.43$\rightarrow$30.63),同时大大简化了训练流程。特别是,\textbf{DP-OPD 通过消除 DP 教师训练和离线合成文本生成,将私有压缩压缩为单个 DP 学生训练循环}。代码将在 https://github.com/khademfatemeh/dp_opd 发布后发布。