论文

最新精确匹配关注

Latest Exact Match Attention

模型架构Transformer

摘要

我们引入了最新的精确匹配注意力(LEMA),这是Transformer的一种注意力变体,其中查询和键被二值化,并且每个查询仅关注最新的完全匹配的键。我们证明具有思想链的 LEMA 转换器可以模拟字 RAM,正如最近限制较少的最右硬注意力所显示的那样。与之前的硬注意力变体相比,对精确匹配的限制实现了有效的相反方向:字 RAM 可以以独立于上下文长度的每个标记的成本来模拟 LEMA 转换器。总之,这些结果在计算和内存方面产生了两种计算模型之间的密切对应。除了理论之外,我们还提出了一种 LEMA 变换器的训练方法,该方法通过用于二值化的直通估计器和针对 LEMA 退火的软注意力代理来处理其不可微分运算。在综合联想召回任务中,以这种方式训练的 LEMA 模型使用其增长状态来存储和召回大量关联,其性能优于具有固定状态大小的门控 DeltaNet (GDN)。作为第一个扩展测试,我们训练了具有多达 8.34 亿个参数的 LEMA 语言模型。它们在损失方面与大约一半大小的 Softmax Transformer 相匹配,并且在重复的罕见短语和针检索任务中,仍然落后于 SoftMax Transformer,但比同等大小的 GDN 模型回忆的距离更长。最后,我们为 LEMA 转换器实现了基于字典的推理,并显示出与 GDN 相当的恒定生成速度,尽管它们处于不断增长的状态,字典驻留在主存储器而不是 VRAM 中。代码可从此 https URL 获取。