论文
差异隐私如何影响 LLM 中的社会偏见?系统评估
How Does Differential Privacy Affect Social Bias in LLMs? A Systematic Evaluation
摘要
在网络规模的语料库上训练的 大语言模型 (LLM) 可以记住敏感的训练数据,带来重大的隐私风险。差分隐私(DP)已成为限制训练期间单个数据点影响的原则框架,但 LLM 中差分隐私与社会偏见之间的关系仍然知之甚少。为了研究这一点,我们对使用 DP-SGD 训练的预训练 LLM 进行了社会偏见的系统评估,在四个互补范例中将 DP 模型与非 DP 基线进行比较:句子评分、文本完成、表格分类和问题回答。我们发现 DP 减少了句子评分任务中的偏差,其中偏差是通过受控可能性比较来衡量的,但这种改进并不能推广到所有任务。我们的结果揭示了 logits 级偏差和输出级偏差之间的差异。此外,减少记忆量并不一定会减少不公平性,这凸显了在评估 LLM 公平性时多范式评估的重要性。