论文
在 DP-SGD 下的私人环境中,权重绑定对于仅解码器的 LLM 仍然有益吗?
Is Weight Tying Still Beneficial for Decoder-Only LLMs in Private Settings Under DP-SGD?
摘要
差分隐私随机梯度下降 (DP-SGD) 是大语言模型 (LLM) 隐私保护微调的领先方法。许多仅解码器的 LLM 在输入和输出嵌入之间采用权重绑定,这种设计选择最初是为了参数效率和提高非私有设置中的语言建模性能而引入的。然而,在差异化私人训练下绑重的影响在很大程度上仍未被探索。在这项工作中,我们使用 GPT2 和 DistilGPT2 作为代表性的仅解码器架构来研究权重绑定在 DP 设置中的作用。有趣的是,我们发现未绑定嵌入在 DP-SGD 下始终优于权重绑定模型,在 SST-2、QNLI 和 QQP 上实现了高达 4.74% 的准确率提升。除了改进实用性之外,解开嵌入还可以为 DP-SGD 使用内存高效的重影裁剪。相比之下,权重绑定引入了共享参数交互,这使得标准鬼范数计算变得复杂,并在很大程度上抵消了其计算优势。因此,未绑定模型的内存使用量降低了 60% 以上,同时保留了重影裁剪的优势。我们的结果表明,非绑定嵌入为仅解码器 LLM 的差分隐私训练提供了更有效和可扩展的设计,并强调需要在隐私保护环境中重新审视标准 LLM 架构选择。