论文
ITS:通过独立词元采样检测扩散语言模型的训练数据使用
Weak Ties, Strong Signals: Efficient Training Data Detection in Diffusion LLMs via Independent Token Sampling
摘要
扩散大语言模型 (dLLM) 为自回归模型提供了一种引人注目的替代方案,但它们可能会在去噪过程中暴露敏感的训练数据。检测这种用法具有挑战性,因为 dLLM 缺乏因果架构的高效一次性概率分解。现有方法依靠随机掩码在有限的查询预算下获得易于处理的标记检测信号,但无法控制掩码标记之间的依赖性。我们证明,这种逐词近似引入了非负结构估计误差,理论上其特征是屏蔽标记之间的累积条件互信息(CMI),并且可以掩盖微妙的记忆信号。这一见解表明,可靠的检测需要具有弱内部依赖性的屏蔽标记集。为了避免直接估计词元组合上的 CMI 的高昂成本,我们提出了 \textit{独立词元采样} (ITS),这是一种查询高效的框架,它使用注意力派生的成对依赖代理来近似 CMI 感知选择标准。 ITS 进一步采用了多样性促进策略,以提高采样轮次中的词元覆盖率,从而产生受依赖引起的近似误差影响较小的聚合词元明智信号。对多个数据集的实验表明,ITS 在不同模型和数据集上始终优于最先进的基线,在 ArXiv 数据集上实现了 0.18 的 AUC 改进,同时在有限的查询预算下保持了强劲的性能。该代码可在此 https URL 获取。