论文

自动还是受控?重复启动揭示了基础 LLM、指令 LLM 和人类的发散处理

Automatic or Controlled? Repetition Priming Reveals Divergent Processing in Base LLMs, Instruct LLMs, and Humans

模型评测模型行为与机制分析

摘要

单词在自然语言使用中不断重复出现,但尚不清楚语言模型是否会重新激活先前的表示或重新评估重复的单词,以及 后训练 是否会改变这种默认行为。我们将重复启动(Shiffrin 和 Schneider,1977)应用于语义分类和完形填空两项任务中的 5 个模型系列(1.5B-14B 参数)的 15 个模型,并使用相同的刺激进行匹配的人体实验。我们发现基础模型表现出自动处理:它们表现出即时促进,在滞后期间保持稳定,部分在上下文删除后幸存下来,并且与对先前发生的事件的关注相关。指导模型表现出受控处理:它们的促进作用会随着滞后而衰减,在没有预期背景的情况下崩溃,并在更大范围内逆转为干扰。在 Qwen 2.5 系列中,这种分离随着模型规模单调增加,表明 后训练 逐渐改变重复处理。人类表现出混合特征,具有类似于指导模型的滞后敏感促进作用,但没有干扰,这表明这两种模型类型都不能完全捕捉人类认知。我们的研究结果揭示了 后训练 之后语言模型处理重复信息的方式发生了质的转变,并为模型行为之间的差异提供了机制证据。