论文
TIDE:每一层都知道上下文下的词元
TIDE: Every Layer Knows the Token Beneath the Context
摘要
我们重新审视每个现代 LLM 中普遍接受但未经充分审查的设计选择:在输入嵌入层查找词元索引一次,然后永久丢弃。这种单注入假设会导致两个结构性故障:(i)稀有词元问题,其中词汇的 Zipf 型分布会导致稀有词元嵌入长期训练不足,因为与普通词元相比,接收到的累积梯度信号只占一小部分; (ii) 上下文崩溃问题,其中有限参数模型将分布上相似的标记映射到无法区分的隐藏状态。为了解决这两个问题,我们提出了 TIDE,它通过 EmbeddingMemory 增强了标准 Transformer:K 个独立 MemoryBlock 的集合,将标记索引映射到上下文无关的语义向量,计算一次并通过具有可学习空库的深度条件 Softmax 路由器注入到每一层。我们从理论上和经验上证明了 TIDE 在解决与单词元身份注入相关的问题以及提高跨多语言建模和下游任务的性能方面的优势。