PAC-Private 自回归生成:校准噪声以消除系综差异
PAC-Private Autoregressive Generation: Calibrating Noise to Ensemble Disagreement
摘要
适用于私有文本的语言模型通常通过 API 提供服务,因此隐私泄露是通过生成的输出而不是暴露的权重发生的。私人预测保护这些发布。 PMixED 等方法在每次发布时都会产生隐私成本,并且从长远来看越来越依赖公共模型。相反,PAC 隐私会校准噪声以输出可能秘密的可变性,从而在预测稳定时增加更少的噪声。据我们所知,PAC-private 预测之前尚未从分类扩展到自回归生成。我们从私有语料库构建 $m=128$ 重叠世界,每条记录恰好出现在 $m/2$ 世界中,并在冻结的公共模型上为每个世界训练一个适配器。实现的世界是秘密。对于每个词元,公共模型定义了一个候选集、世界投票,并且它们的后验加权分歧决定了 PAC 噪声;一致意见不需要校准噪声。我们证明 $I(S;Y_{1:T}) \leq I(S;H_T) \leq bT$。我们的贡献是将 PAC 隐私扩展到自回归生成,处理自适应自生成上下文,并引入耦合解码来保留隐私核算,同时避免贪婪退化。在使用 GPT-2-small 的 WikiText-103 上,我们在每个 词元预算 为 $2^{-32}$ 时保留了 74% 的 微调 增益,而在 $10^6$ 词元后,成员资格推断成功率受到 51.08% 的限制;泄漏的后验熵估计大约是收费预算的 17%。推理隐私不是内容保护:即使记忆的金丝雀的成员优势与零无法区分,金丝雀也会以相同的速率发出。与在相同数据宇宙和测试集上匹配的成员推理边界下的 PMixED 相比,我们保留了从 10^2$ 到 $10^6$ 词元的 98% 的非私有净空,而没有交叉的情况下最多保留 56%。