论文

对离散扩散语言模型的成员推理攻击

Membership Inference Attacks on Discrete Diffusion Language Models

模型评测安全与风险评测

摘要

掩蔽扩散语言模型 MDLM 用迭代去掩蔽取代了自回归生成,并且它们的隐私属性基本上未被研究。我们研究了微调 MDLM 上的成员推理攻击 MIA,并表明它们比当前灰盒基线显示的更容易受到攻击。我们从四个掩蔽比的模型重建损失中提取 46 维特征向量,并在顶部训练 XGBoost 和 MLP 分类器。在跨六个文本域的 MIMIR 基准测试中,XGBoost 在 Pile CC 上实现平均 AUC 0.878,峰值为 0.930,平均比 SAMA 灰盒基线高 0.062 AUC。留一信号消融表明,ELBO 轨迹独自驱动了大部分,当移除时,平均下降为 0.130,而注意力特征几乎没有添加低于 0.003 的值。我们还设计了一种影子模型转移攻击,其中 K 等于 3 个代理 MDLM,这些代理 MDLM 在来自不相关域的数据上进行训练,生成无法访问目标域的分类器标签。这在白盒预言机的 0.020 范围内实现了 0.858 平均 AUC,并将影子模型传输建立为实用且几乎同等有效的攻击路径。