论文

大语言模型 中动态实体跟踪的检索条件重新绑定电路

A retrieval conditioned rebinding circuit for dynamic entity tracking in large language models

模型评测模型行为与机制分析

摘要

为了正确解释上下文并检索相关信息,大语言模型 必须将实体绑定到其属性,并在状态更改时更新这些绑定。我们分析LLM如何在动态跟踪中实现这个绑定过程。使用因果干预,我们确定了一种检索条件重新绑定机制,一个紧凑的注意头电路,用于传播绑定信息,并且当查询实体时,使用更新的绑定来检索相应的属性。在 Gemma 和 Llama 模型中,该电路支持重新绑定行为,但该机制的代表性签名因模型系列而异。在 Gemma 模型中,绑定签名在相关注意头的查询/密钥子空间中清楚地表达,而在 Llama 模型中,绑定信息主要在密钥向量中携带。总的来说,我们的结果揭示了 LLM 中上下文相关状态跟踪的可解释机制。