论文
通过 词元级 记忆不对称进行微调扩散语言模型中的成员推理
Membership Inference in Fine-tuned Diffusion Language Models via Token-level Memorization Asymmetry
摘要
扩散语言模型 (DLM) 最近已成为自回归 LM 的替代建模范例,具有并行生成和双向上下文建模等优势。尽管人们对其生成能力越来越感兴趣,但 DLM 的隐私风险仍未得到充分探索。我们通过扩散训练动力学的理论分析发现了一种称为 词元级 记忆不对称的现象。基于这一发现,我们提出了 Q-Skew,一种基于分位数加权偏度的指标,用于微调 DLM 的成员资格推断。跨多个 微调 数据集和模型的实验表明,我们的方法优于现有基线。此外,我们表明 Q-Skew 还可以促进其他隐私侵犯,例如 PII 提取。我们的研究结果揭示了之前未充分探索的隐私攻击面,并强调了对 DLM 进行系统隐私评估的必要性。