论文

Transformer 可选择性访问早期表示

Transformers with Selective Access to Early Representations

模型架构Transformer

摘要

最近的几个 Transformer 架构将后面的层暴露给最早层中计算的表示,其动机是观察到随着残余流在深度上反复转换,低级特征可能变得更难恢复。这些方法中最便宜的添加静态值残差:学习混合系数,在词元和头之间均匀地暴露第一层值投影 V_1。更具表现力的密集或动态替代方案可以恢复更细粒度的访问,但内存成本更高,吞吐量更低。 V_1 的有用性在 token、heads 和 context 中不太可能保持不变;不同的立场似乎需要不同数量的早期词汇或语义信息的访问。因此,我们将早期表示重用视为检索问题而不是连接问题,并引入选择性访问 Transformer (SATFormer),它保留第一层价值路径,同时使用上下文相关的门控制访问。在从 130M 到 1.3B 参数的模型中,SATFormer 在静态残差值和 Transformer 基线上持续改进了验证损失和零样本精度。其最大的收益出现在检索密集型基准测试中,它比静态值残差提高了大约 1.5 个平均点,同时保持吞吐量和内存使用量接近基线 Transformer。门分析表明稀疏、深度依赖、头部特定和类别敏感的访问模式,支持 SATFormer 学习选择性重用早期表示而不是统一残留复制的解释。我们的代码可从 https://github.com/SkyeGunasekaran/SATFormer 获取。