论文
用于 LLM 的高效 DP-SGD,具有随机限幅
Efficient DP-SGD for LLMs with Randomized Clipping
摘要
大语言模型 (LLM) 在可能包含敏感信息的大量数据集上进行训练。差分隐私(DP)是正式隐私保证的事实标准,为训练具有可证明隐私保护的 LLM 提供了原则框架。然而,最先进的 DP 训练实现依赖于快速梯度裁剪技术,内存开销为 $O(B \min\{T^2, d^2\})$,其中 $B$ 是批量大小,$T$ 是序列长度,$d$ 是模型宽度。随着模型大小和上下文长度的增长,这变得令人望而却步。我们提出了 DP-SGD-RC,这是 DP-SGD 的一种新颖变体,具有随机裁剪功能,可减少内存和计算复杂性。 DP-SGD-RC 利用随机迹估计方法,特别是 Hutchinson 估计器 [Hutchinson,1989] 及其改进变体 Hutch++[Meyer 等人,2021],来减少每个样本梯度范数估计的内存占用。我们提供了严格的隐私分析,表明 DP-SGD-RC 实现了与确定性削波相媲美的噪声乘数。在涵盖分类、问答和摘要任务的长上下文基准上进行的 微调 Llama~3.2-1B 实验表明,DP-SGD-RC 与基线实用性相匹配,同时显着降低了内存和计算要求。