论文
LLM 可以泄露训练数据,但他们愿意吗? LLM 中记忆倾向感知评估
LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs
摘要
大语言模型可以重现训练数据,但现有的记忆评估主要衡量模型是否可以被迫这样做,而不是在正常使用下是否这样做。我们介绍了 PropMe,这是一种用于记忆评估的倾向感知框架,它将基于前缀的能力攻击与非对抗性评估进行了对比。我们提出了一种度量转换,将其应用于现有函数,可以创建倾向度量。我们进一步介绍了 SimpleTrace,这是一个基于 infini-gram 构建的轻量级跟踪管道,它确定性地将模型生成归因于大规模训练语料库,并计算逐字、近逐字和倾向转换的记忆指标。在两个数据集(两种语言的 Common Pile 和 Dynaword)上评估两个完全开放的模型:Comma 和 DFM Decoder,我们发现能力和倾向之间存在一致的差距:前缀攻击比通用或特定于数据集的提示引发更强的记忆信号,而倾向得分总体上仍然较低。因此,这些模型可以在直接引出时揭示训练数据,但在更常见的非对抗性环境中很少这样做。我们还发现,持续从 Comma 进行预训练的 DFM Decoder 对 Common Pile 表现出较低的记忆力和记忆倾向,这证实了当后期训练强调部分不同数据时,记忆能力会下降。我们的结果表明,并且我们鼓励,记忆审核应该报告最坏情况的可提取性和普通的泄漏倾向,以便更全面地了解这种现象。