论文

记忆与语境?语言模型中事实回忆的影响因素

Memory vs. Context? Influential Factors of Factual Recall in Language Models

模型评测模型行为与机制分析

摘要

我们重现了 Yu 等人的工作并对其进行了压力测试。 (2023),他描述了语言模型(LM)如何在记忆的知识和矛盾的上下文语句之间进行仲裁。我们在 Pythia、GPT-2、Qwen3 和 Ministral 系列的 31 个模型上复制了他们的世界首都实验,包括基础变体和训练后变体,并将评估扩展到 ParaConflict 数据集中的五种其他知识关系类型。我们凭经验证实了他们的大部分原始发现:更大的模型和更高频率的实体往往更喜欢记忆的答案,并且家庭层面的差异很大。然而,有几个结论并不能完全概括:实体频率效应在 Qwen3-14B 和 32B 上消失;训练后会在不同家庭之间不一致地改变记忆-情境权衡;仅问题措辞就可以将模型对记忆知识的依赖改变高达 80 个百分点;语义上不相关的散文可以模仿连贯的支持上下文。我们的结果阐明了 Yu 等人的主张的成立以及它们在多大程度上推广到其他提示。