论文

语言模型是否一致地编码当前年份?

Do Language Models Consistently Encode the Current Year?

模型评测模型行为与机制分析

摘要

当前时间的一致概念对于时间推理非常重要,但语言模型如何表示当前时间尚不清楚。我们贡献了两个以概念上不同的方式探测当前年份的任务:一个关联任务,它从动词时态推断当前年份;另一个任务,它直接查询当前年份。这两项任务都估计指令调整语言模型的 后训练 数据截止后一年内的当前年份。对于基础模型,对关联任务的预测可以作为 预训练 数据截止的有力代理,13 个模型的平均误差仅为 10 个月。然而,它们的内部机制有所不同:联想任务使用类似于事实回忆的机制,而陈述性任务缺乏一致的因果路径。这种差异对更新语言模型的当前年份提出了挑战。提示、SFT 或权重编辑都无法成功同时改变关联年份和陈述年份。提示会更新声明年份(351 个目标年份的成功率为 94.6%),但关联年份几乎保持不变(成功率为 1.7%)。年移 SFT 也无法改变关联年份,仅在八个模型中的一个与目标年份相匹配。权重编辑虽然对这两项任务单独有效,但并不能推广到这两项任务。总的来说,我们的结果表明,当前年份在语言模型中的编码并不一致:在 预训练 中学习的语言结构中根深蒂固的联想概念使用不同的因果机制,并抵制容易改变 后训练 中学习的陈述性概念的相同修改。