论文

与分词器无关的印迹模块

Tokenizer-Agnostic Engram Module

模型架构新型架构

摘要

Deepseek 的 Engram(一种条件记忆模块)被引入以在 大语言模型 中权衡存储与推理。然而,该模块依赖于 词元级 $N$-gram 哈希来进行 Engram 嵌入查找,从而引入了与所使用的分词器的紧密耦合:具有不同分词器的模型必须从头开始训练自己的 Engram 嵌入。为了提高 Engram 嵌入的可重用性,我们建议对哈希例程进行更改,从而实现使用不同标记器的 Engram 模型之间的兼容性。我们不是对不相交的 $N$-gram 空间进行建模,而是将 $N$-gram 视为一种从跨标记的所有可能的字节序列中采样潜在有用的字节序列的方法。我们将基于 XOR 的哈希替换为通用多项式哈希,并在 $N$ 上使用联合嵌入空间。这项工作研究了可能的权衡,并表明这种简单的替换产生了可比较的性能并实现了标记器不可知论:字节等效标记序列的哈希等效性。