论文
语言模型如何在上下文和记忆之间进行选择?
How Do Language Models Choose Between Context and Memory?
摘要
当上下文信息与模型参数中存储的知识发生冲突时,可以使用激活方向来解码和引导模型遵循哪个源。然而,沿着某个方向进行转向并不能建立因果关系:未经编辑的模型是否会自然地使用该方向,或者该方向是否可以跨任务重用。 We test these distinctions through counterfactual experiments in unambiguous settings. First, we estimate authority directions from agreement prompts, in which the context and parametric knowledge support the same answer.然后,我们沿着这些方向在匹配的提示之间交换自然发生的坐标,指导模型优先考虑所提供的上下文或其参数知识。在 Qwen、Llama 和 OLMo 模型中,这种干预再现了 30-68% 的权威引起的来源选择转变,而匹配对照几乎没有再现。为了测试跨任务重用,我们分别学习两个任务的权威方向,发现跨任务可转移性仅缩小了 9% 的权威差距,而在给定任务上学习的本地方向则缩小了 57%。这些结果区分了权威表示、因果使用和跨任务因果重用,并表明权威计算可能是任务相关的,而不是跨任务可重用的。