论文

图形存储器 Transformer (GMT)

Graph Memory Transformer (GMT)

模型架构Transformer

摘要

我们研究了仅解码器 Transformer 中的前馈网络 (FFN) 子层是否可以被显式学习记忆图替换,同时保留周围的自回归架构。所提出的图形存储器 Transformer (GMT) 保持了因果自注意力的完整性,但用一个存储单元取代了通常的每个词元 FFN 变换,该存储单元在由学习的有向转移矩阵连接的学习质心库上路由词元表示。在此研究的基本 GMT v7 实例中,16 个 Transformer 块中的每一个都包含 128 个质心、128 * 128 边缘矩阵、重力源路由、词元条件目标选择和门控位移读数。因此,单元返回从估计的源存储状态到目标存储状态的移动,而不是检索到的值。与评估中使用的 1.03 亿参数密集 GPT 式基线相比,生成的模型是一个完全仅解码器的语言模型,具有 8220 万个可训练参数,并且没有密集 FFN 子层。基本 v7 模型训练稳定,并将质心使用、转换结构和源到目标移动作为前向计算的直接可检查量。它在验证损失和困惑度方面仍然落后于较大的密集基线(3.5995/36.58 vs. 3.2903/26.85),同时在评估的设置下显示出接近的零样本基准行为。这些结果并不旨在作为最先进的主张;它们支持用图介导的记忆导航代替密集的词元内转换的可行性和结构可解释性。更广泛的扩展、优化的内核和更广泛的基准评估留给后续工作。