论文
上下文叠加:大语言模型 中的类人工作记忆干扰
In-context superposition: human-like working memory interference in large language models
摘要
智能系统必须在线维护和操作与任务相关的信息,以适应动态环境。这种能力被称为工作记忆,是人类推理的基础。然而,人类的工作记忆极其有限,在拥有数十亿神经元的大脑中只能保存三到四个项目。令人惊讶的是,尽管 大语言模型 (LLM) 的基质不同并且通过注意力直接访问先前的上下文,但它表现出类似的工作记忆限制。为什么如此不同的系统要面临类似的限制?我们认为工作记忆的限制反映了共享表示的一般权衡:表示压缩和重用支持有效的学习和泛化,但同时也会导致主动表示干扰。我们展示了在工作记忆任务上训练的两层 Transformer 可以完美地解决这个问题,但是经过多种训练的 LLM 表现出类似人类的局限性:性能随着记忆负载的增加而下降,而检索则因新近度和刺激统计数据而出现偏差。与人类相似,LLM 中的工作记忆性能也与更广泛的模型功能相关。从机制上讲,我们表明 LLM 以纠缠表示形式编码多个记忆——我们称之为 \emph{上下文叠加} 的条件——并逐步抑制竞争内容,同时将目标与读数对齐。此外,抑制干扰信息的因果干预可以提高性能。总之,这些发现表明,工作记忆容量反映了在干扰下选择与任务相关的信息的能力,这是生物和人工系统共同面临的计算挑战。