论文
MC-PDD:黑盒 大语言模型 的屏蔽语料库级预训练数据检测
MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models
摘要
预训练是 大语言模型 (LLM) 开发的基础,但预训练数据的不透明性使模型分析变得复杂,并引发了伦理、法律和公平问题。因此,检测预训练期间是否使用了特定数据集至关重要。现有的最先进方法通常依赖于对模型概率分布的访问,这使得它们不适合仅提供输入输出接口的闭源 LLM。为了解决这个限制,我们引入了屏蔽语料库级预训练数据检测(MC-PDD),这是一种受屏蔽语言建模范式启发的新颖方法。 MC-PDD 屏蔽每个文本中高度特定的标记,并提示 LLM 预测缺失的内容。然后,它评估候选语料库和参考非成员语料库之间的预测命中率差异是否具有统计显着性。根据此比较,MC-PDD 确定候选文本是否可能包含在模型的预训练数据中。实验结果表明,对于开源和闭源 LLM,三个数据集中的预训练数据和未见过的数据之间的预测命中率存在明显且一致的差异。尽管在更严格的黑盒设置下运行,MC-PDD 仍能实现与现有检测方法相当的性能。我们的方法仅使用标准 API 访问即可实现模型审核和数据版权验证等实际应用。接受后,我们将公开发布代码和数据集。