论文

JUMP:微调扩散语言模型的单次成员推断攻击

JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models

模型评测安全与风险评测

摘要

公开的开放权重语言模型在部署前常在私有或领域数据上微调,这产生了审计个别记录是否被用于适配的需求。我们针对离散扩散语言模型(dLLM)研究该问题,以微调前检查点为参照。与自回归模型不同,dLLM允许任意掩码集合,并并行返回所有被掩码位置的预测。SAMA对大量随机掩码平均重建信号,这可能稀释有信息量的位置且需要重复模型评估。我们提出JUMP(联合不确定性引导掩码探查):选择参考置信度低的位置、联合掩码它们,并从每个模型一次打分查询中聚合截断的目标—参考重建差距。在六个MIMIR领域上,JUMP把LLaDA-8B-Base的平均ROC-AUC从0.819提高到0.902,Dream-v0-Base-7B从0.851提高到0.942,而每样本仅需三次模型前向,对比SAMA的32次。

JUMP:微调扩散语言模型的单次成员推断攻击:论文配图
图 1:JUMP 概述。攻击首先在参考模型下选择信息丰富的位置,然后联合屏蔽所选位置,并使用目标和参考 dLLM 对其进行评分。最终的 MIA 统计数据是根据修剪的标记级目标/参考重建间隙计算得出的。在可视化中,一般标记由实线框表示,而置信度分数由虚线框表示。