论文
通过填充从扩散语言模型中提取训练数据
Extracting Training Data from Diffusion Language Models via Infilling
摘要
大语言模型 中的记忆几乎完全通过前缀条件提取进行研究,这是自回归模型的自然选择。然而,扩散语言模型(DLM)可以对任意位置的屏蔽标记进行去噪。因此,仅前缀探测仅揭示了 DLM 中记忆的一个方面,并且大大低估了训练数据提取的风险。为了真实地模拟 DLM 中训练数据的可提取性,我们引入了 \emph{填充提取},这是一种由任意二进制掩码参数化的数据提取协议,该协议包含仅前缀探测并解释了 DLM 的双向归纳偏差。在 LLaDA-8B 和 Dream-7B 上实例化它,涵盖五种提取模式、三个训练管道和三个覆盖逐字和部分泄漏的语料库,我们发现掩模几何形状控制着可提取性:边缘条件掩模\emph{提取的逐字序列比前缀条件掩模多三倍},双向访问打开了自回归模型中无法访问的通道。特别是,我们表明,与从规模匹配的自回归模型相比,能够访问个人身份信息已被编辑的训练数据的现实对手甚至可以从 DLM 中提取经过编辑的电子邮件地址获得更高的召回率。用于解码的可调参数会显着影响提取性能,而后续的监督微调阶段不会消除先前的记忆。