论文

DP-SelFT:大语言模型 的差分私有选择性 微调

DP-SelFT: Differentially Private Selective Fine-Tuning for Large Language Models

模型训练参数高效训练

摘要

大语言模型 (LLM) 通常通过 微调 适应下游任务,但 微调 数据通常包含可能被结果模型泄露的敏感信息。差分隐私 (DP) 提供了针对此类泄漏的正式保护,但 LLM 的 DP 微调 仍然因梯度限幅和噪声注入而遭受严重的效用下降。现有的工作通过将 DP 与参数高效的 微调 方法(例如 LoRA)相结合来改善这种权衡,这些方法限制了更新的形式。在这项工作中,我们研究了一个补充方向:选择性 微调,它限制了应用更新的位置。我们提出 DP-SelFT,这是 LLM 的差分隐私选择性 微调 的框架。 DP-SelFT 解决了参数选择中三个 DP 特定的挑战:避免重复的隐私成本、提高噪声估计下的稳定性以及选择在裁剪和噪声更新下仍然有用的参数。它首先构建一个轻量级的DP合成数据集,并仅对该合成数据进行选择,因此选择阶段不会产生额外的隐私成本。然后,它通过在综合训练分割上临时训练候选层子集并在综合验证分割上评估它们来进行层级选择。至关重要的是,这种临时训练是在与下游 DP 微调 匹配的扰动机制下进行的,最坏情况的扰动与 DP 噪声的规模相同。这有利于层子集不仅是可学习的,而且对嘈杂的私有更新也具有鲁棒性。基准任务实验表明,在相同的隐私保证下,DP-SelFT 相对于现有 DP 微调 基线,持续改善了隐私与效用的权衡。