论文
JUMP:微调扩散语言模型的单次成员推断攻击
JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models
摘要
公开的开放权重语言模型在部署前常在私有或领域数据上微调,这产生了审计个别记录是否被用于适配的需求。我们针对离散扩散语言模型(dLLM)研究该问题,以微调前检查点为参照。与自回归模型不同,dLLM允许任意掩码集合,并并行返回所有被掩码位置的预测。SAMA对大量随机掩码平均重建信号,这可能稀释有信息量的位置且需要重复模型评估。我们提出JUMP(联合不确定性引导掩码探查):选择参考置信度低的位置、联合掩码它们,并从每个模型一次打分查询中聚合截断的目标—参考重建差距。在六个MIMIR领域上,JUMP把LLaDA-8B-Base的平均ROC-AUC从0.819提高到0.902,Dream-v0-Base-7B从0.851提高到0.942,而每样本仅需三次模型前向,对比SAMA的32次。
