论文

语法引导的稀疏注意力,实现高效且可解释的 Transformer

Grammatically-Guided Sparse Attention for Efficient and Interpretable Transformers

模型架构Transformer

摘要

Transformer 模型中自注意力的二次复杂度仍然是处理长序列和高效部署 大语言模型 的重要瓶颈。对于这种方法,人们对稀疏注意力进行了大量研究,Deepseek Sparse Attention结合了各种创建标记片段的方法来降低时间复杂度。本文介绍了一种新颖的方法,即语法引导的稀疏注意力,它根据标记的语法角色来限制注意力计算。通过利用词性 (POS) 标签,动态生成注意掩码,以加强标记之间的语言连贯连接,从而在不牺牲基本语言依赖性的情况下减少计算图。提出并评估了两种屏蔽策略:严格只允许预定义的语法交互的硬屏蔽,以及将注意力偏向这些交互的软屏蔽。这些实验使用类似 DistilBERT 的架构在 SST-2 情感分类任务上进行,表明语法引导的稀疏注意力保持了与完全注意力相当的准确性,同时显着降低了理论计算开销。初步结果显示,硬掩蔽的准确度值为 0.8200,软掩蔽的准确度值为 0.8165,与完全注意力的 0.8200 非常接近,为更高效、可解释和语言信息丰富的 Transformer 架构提供了一条途径。