论文
记忆表盘:语言模型中可控记忆的训练框架
Memory Dial: A Training Framework for Controllable Memorization in Language Models
摘要
语言模型中的记忆被广泛研究,但仍然难以分离和控制。了解模型何时记忆以及记忆什么内容对于解释其预测至关重要,但现有方法是事后的:它们可以检测训练模型中的记忆,但无法将其影响与架构、数据或优化区分开来。我们引入了 Memory Dial,这是一个训练框架,它使记忆压力成为一个明确的、可控的变量。记忆表盘通过单个参数 $α$ 在标准交叉熵和温度锐化目标之间进行插值,产生一系列在架构和训练设置(每次扫描内)相同的模型,仅在记忆压力方面有所不同。六种架构和五个基准的实验表明:(1)$α$ 可靠地控制了记忆压力,见过的例子的准确性单调增加,而看不见的准确性保持稳定; (2) 模型越大,对记忆压力的反应越灵敏; (3)频繁的序列比罕见的序列更容易记忆。其他分析表明,该效果在一系列锐化温度下都很稳健,与单温度交叉熵有质的不同,可以转移到多语言设置,甚至在自然发生的单次出现序列上也可以检测到。记忆表盘提供了一个受控实验框架,用于研究记忆行为如何出现以及如何与语言模型中的泛化相互作用。