论文
张量印迹:在 N-Gram 嵌入之间共享潜伏在 LLM 中是有益的
Tensorizing Engram: Sharing Latents Across N-Gram Embeddings is Beneficial in LLMs
摘要
现代语言模型使用离散的 词元级 嵌入来表示文本,这迫使在 Transformer 层中隐式学习重复出现的多标记模式。过度标记化 Transformer 和 Engram 都试图通过显式合并多标记(n-gram)存储器来解决此限制。然而,它们依赖于每个 n-gram 顺序的单独哈希表,这会引入哈希冲突并阻止嵌套 n-gram 共享底层潜在结构。为了解决这些问题,我们提出了张量化印迹(TN-gram),这是一种紧凑的内存模块,它通过规范多元(CP)形式的共享因子来表示张量化的 n-gram 嵌入。 TN-gram 学习共享标记位置因子以及顺序吸收向量,以对不同 n-gram 顺序的嵌入进行编码。综合实验表明,TN-gram 可以匹配甚至优于 Engram 风格的 n-gram 模块,同时需要的参数要少得多。