论文
MoME:用于上下文感知稀疏查找的内存混合嵌入
MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
摘要
有效扩展大型语言模型激发了稀疏容量机制,例如专家混合,以及最近的条件记忆:通过廉价参数查找来增强主干的词元索引嵌入表。现有的记忆嵌入方法通过表面形式的确定性函数进行检索,该函数将同一标记的不同上下文含义(例如,Python 语言与动物)折叠成单个固定条目。我们引入了混合内存嵌入(MoME),这是一种上下文感知的内存机制,它将每个词元的单个内存行替换为 M 个插槽的混合,并使用隐藏状态上的学习门来选择在每个位置读取哪些插槽。在跨 nanochat、Llama-3/MobileLLM 和 Qwen3 主干的受控预训练实验中,MoME 在 iso-parameter 和 iso-training-FLOP 设置中改进了 Value Embedding、Bigram 和 STEM 基线,显示出更有前景的十亿级内存大小扩展趋势,并且在训练和推理中保持高效。对多义标记的定性路由分析进一步表明,学习的混合物表现出一定程度的语义可解释性,将相同的表面标记分派到不同含义下的不同内存插槽。