论文

从第一原理中提取记忆

Extractable Memorization From First Principles

模型评测评测方法与指标

摘要

最近关于语言模型中可提取记忆的研究遇到了两个截然不同的有效性问题。一些研究夸大了提取,例如,使用太短的序列来区分记忆和可预测性。其他人则暗示提取是不可靠的证据,因为模型可以重现它们未经过明确训练的真实世界文本。两者都忽略了有效提取的要求:模型必须生成具有足够高概率的训练序列来表明记忆。为了确定什么足够高,必须进行匹配比较,测量训练序列和可比较的非训练序列的生成概率。由于非训练序列无法被记住,因此它们的概率是可预测性的基线;超过这个基线就是记忆的证据。我们将匹配比较形式化为(1)从群体中采样序列时校准到选定假阳性率的保形测试,以及(2)针对匹配的非训练文档进行校准的单文档普查。匹配的比较可以实现严格的、校准的记忆声明,并澄清先前的设置在哪里存在有效性问题。在维基百科上,OLMo 2 32B 再现非训练 10-token 后缀的频率约为训练后缀的 24%:该比例反映了误报,而不是记忆。对于书本上的 Llama 3.1 70B,校准的普查阈值低至 10^(-27),支持对没有可行采样预算提取的序列的记忆要求。因此,我们改进了“可提取记忆”,以要求有效的记忆要求和在现实预算内接近确定的生成。