论文
LLM 文字工厂内部
Inside the LLM Word Factory
摘要
Transformer 语言模型处理作为子词片段提供的输入,但自然语言语义通常依赖于词级概念。去标记化是模型协调这两个事实的过程,通过计算将子词聚合成词级表示。之前的工作发现,这主要发生在早期到中期的层中,但到目前为止,该过程的确切机制尚未确定。我们在受控配对实验中使用激活补丁深入研究去标记化,隔离不同模型组件的贡献,将 Llama2-7B 中的英语去标记化本地化为第 1 层的两阶段过程。注意力机制从非最终子词传输特定于标记的信号,必要时使用顺序中继,而 MLP 将其与本地嵌入组合在一起。这种两阶段结构可推广到来自 8 个系列的 12 个模型,但其发生的深度取决于位置编码的风格:基于 RoPE 的模型去标记化超过 1 到 5 层,而学习绝对模型则需要 5 到 10 层。最后,我们提供了一个探针,用于仅基于早期层激活来确定去标记化过程的成功,根据上下文的数量,以 0.94-0.97 AUROC 执行。