论文

PACZero:通过符号量化的语言模型的 PAC-Private 微调

PACZero: PAC-Private Fine-Tuning of Language Models via Sign Quantization

模型训练监督微调与指令调优

摘要

我们引入了 PACZero,这是 微调 大语言模型 的 PAC 私有零阶机制系列,它在 $I(S^*; Y_{1:T})=0$ 处提供可用的效用。这种隐私制度将会员推断攻击(MIA)后验成功率限制在先前,即 DP 框架仅在 $\varepsilon=0$ 和无限噪声时匹配的 MIA 抵抗水平。下面的所有 DP-ZO 比较均在 MIA 后验水平上进行匹配。关键的见解是,PAC Privacy 仅在发布取决于哪个候选子集是秘密时才对相互信息收费。符号量化子集聚合的零阶梯度会产生频繁的一致,每个候选子集都同意更新方向的步骤;在这些步骤中,释放的符号的条件互信息成本为零。我们提出了两种跨越隐私与实用权衡的变体:PACZero-MI(通过对二进制版本进行精确校准来预算 MI)和 PACZero-ZPL($I=0$ 通过在分歧步骤上进行统一的硬币翻转)。我们在 LoRA 和全参数轨道上使用 OPT-1.3B 和 OPT-6.7B 评估 SST-2 和 SQuAD。在 $I=0$ 处的 SST-2 OPT-1.3B 完整 微调 上,PACZero-ZPL 达到 ${88.99\pm0.91}​​$,在非私有 MeZO 基线 ($91.1$ FT) 的 $2.1$pp 范围内。先前的方法都没有在高隐私机制 $\varepsilon<1$ 中产生可用的效用,并且 PACZero-ZPL 在 $I=0$ 时在 OPT-1.3B 和 OPT-6.7B 上获得了有竞争力的 SST-2 精度和非平凡的 SQuAD F1。