论文
你的Transformer可以同时容纳两个想法:大语言模型线性叠加的证据
Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
摘要
虽然大型语言模型 (LLM) 依赖于高度非线性的组件,但在这项工作中,我们证明它们表现出基本的线性:当来自不同文本流的输入线性组合时,模型输出各个下一个词元分布的叠加。我们将其称为 \textit{叠加线性假设}。我们提供的证据表明,叠加是 Transformer 架构的固有属性,而不是训练的自然结果;事实上,我们观察到随着预训练的进行,它往往会减少。然而,我们证明,通过轻量级微调可以基本上恢复线性,从而显着减少预测的下一个词元分布与单个下一个词元分布的平均值之间的差异。最后,我们引入了一种引导解码过程,可以解开叠加的输出,从而能够从单个前向传递同时生成两个相干的延续。