论文

筛查就足够了

Screening Is Enough

模型架构Transformer

摘要

当查询键相关性的值位于固定的有界范围内、既不依赖于竞争键也不依赖于序列长度、不需要依赖于序列长度的校准并且可以全部为零时,我们将查询键相关性称为绝对相关性。为了实现这个概念,我们引入了筛选,其显式阈值将有界查询——关键相似性转换为相关值,从而实现在通用范围内的精确拒绝、空选择和直接检查。在匹配的 Transformer 主干上对 12 种注意力机制进行的受控比较中,只有筛选才能保持低长上下文困惑度和超出训练上下文的稳健检索;值得注意的是,它在没有推理时间缩放的情况下实现了这一点。在筛选的基础上,我们引入了 Multiscreen,这是一种由并行门控筛选块组成的语言模型架构。与 Transformer 基线相比,Multiscreen 保留了这些长上下文增益,同时实现了更高的参数效率、更强的通用零样本下游性能、更低的大规模训练成本以及更低的模型端首次标记时间。我们进一步开发了一种标准化设计,即使在 1的学习率下也能保持多屏幕训练稳定,并表明改编版本同样可以在相同的学习率下稳定 Transformer。