论文
检测大语言模型中的数据污染
Detecting Data Contamination in Large Language Models
摘要
大语言模型(LLM)的训练使用了大量数据,其中一些可能来自受版权保护的来源。成员推断攻击(MIA)旨在检测这些文档以及它们是否已被纳入LLM的训练语料。黑盒MIA需要大量的数据操作,因此它们之间的比较往往颇具挑战。我们在黑盒假设下研究了最先进(SOTA)的MIA方法,并使用统一的一组数据集将它们相互比较,以确定是否有任何方法能够在SOTA LLM下可靠地检测成员关系。此外,我们还开发了一种名为Familiarity Ranking的新方法,以展示黑盒MIA的一种可能路径,从而给予LLM更大的表达自由度,以便更好地理解其推理。结果表明,没有任何方法能够可靠地检测LLM中的成员关系,所有方法在多个LLM上的AUC-ROC都约为0.5。更先进的LLM具有更高的TPR和FPR,这表明其具备更强的推理和泛化能力,也凸显了使用黑盒MIA检测LLM成员关系的难度。