论文
中间填空预训练的记忆动力学
Memorization Dynamics of Fill-in-the-Middle Pretraining
摘要
中间填充(FIM)是一种广泛用于为因果语言模型配备填充能力的预训练目标,但其对逐字记忆的影响仍未得到充分研究。我们通过在包含重复古腾堡摘录的 FineWeb-Gutenberg 语料库上预训练具有 FIM 和标准从左到右 (LTR) 目标的 Llama 3.2 模型,在受控环境中研究 FIM 的记忆动态。使用基于前缀的探测,FIM 通常会恢复短的或部分匹配的跨度,而 LTR 通常会为长的精确延续分配高置信度。我们观察到 FIM 训练下的逐字提取随着测试范围内的重复次数近似线性增长。评估原生 FIM 格式探针表明后缀上下文是不够的:FIM 训练下的逐字回忆仍然强烈锚定在前缀上下文中。我们的结果还表明,仅评估一种跨度长度或探测格式可能会错过记忆行为中的重要细微差别。