论文
Lngram v2:具有可解释离散表示的潜在 N-Gram 内存
Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations
摘要
Transformer 缺乏本机查找机制,需要重复的密集计算来识别和重用本地静态模式。 lngram v1 通过离散潜在 n-gram 寻址引入了独立于分词器的条件内存,但其内存容量与主干宽度耦合,由于高参数和激活成本而限制了可扩展性。我们提出了 Lngram v2,它将路由数量、内存维度和骨干宽度解耦,并引入上下文感知的分组查询注意力读出来独立扩展内存容量。零值接收器和反事实代理梯度进一步提高了读出选择性和路由可训练性,同时保留了硬离散寻址。不同规模的视觉语言模型 (VLM) 的实验显示出一致的改进,包括成功扩展到 30B 参数模型。与 Lngram v1 相比,Lngram v2 大幅减少了总内存参数和激活内存参数,同时保持或提高了语言建模性能。进一步的分析表明,其离散 ID 保留了连续隐藏状态的实质性语义结构,从而能够仅从 ID 进行语义恢复,并实现跨数据集的稳定 ID 语义关联。这些结果将 Lngram v2 确立为一种高效且可扩展的潜在条件内存机制,其离散地址还提供了用于分析内部模型表示的结构化接口。