论文
当上下文发生变化时:了解大语言模型中的更新失败
When Context Changes: Understanding Update Failures in LLMs
摘要
随着偏好、目标和事实的变化,LLM Agent必须使用当前状态,而早期版本仍保留在上下文中。然而,他们可以用同一变量的旧值来回答,我们称之为陈旧绑定的失败。为了研究模型何时使用过时的信息以及原因,我们引入了受控上下文内存 (CICM),这是一个用于跟踪和使用对话和Agent日志中更新信息的基准。我们观察到,即使是前沿推理模型也可能无法恢复当前状态。我们发现,在开源模型中,当模型使用旧值进行应答时,探测器仍然可以恢复更新后的值,这表明无法选择仍然可用的信息。 Qwen 和 Pythia 中的组件测试确定了这种选择失败的机制:注意力漂移,即在产生答案时注意力更倾向于旧值而不是当前值。我们研究了一个单层Transformer,从数学上理解这种现象是如何发生的:当注意力分数相似时,几个旧值一起可以比当前值获得更多的关注。在这个解释的指导下,我们将注意力转向当前值,而无需进一步训练。当直接请求当前值时,调整每个输入的干预可以纠正各个模型系列中的大多数旧值错误,同时保留几乎所有最初的正确答案。因此,可靠的上下文管理需要的不仅仅是记住更新的信息:模型必须使用它来指导他们的答案。