论文

稀疏注意力中信息损失与泛化之间的权衡

On the Trade-off Between Information Loss and Generalization in Sparse Attention

模型架构Transformer

摘要

为了缓解 Transformer 的二次复杂度瓶颈,稀疏注意力已成为一项关键技术。尽管稀疏 Transformer 取得了广泛的经验成功,但对稀疏注意力的理论理解仍然支离破碎。特别是,两个基本问题仍不清楚:(1)稀疏化如何影响注意力机制的信息保真度? (2)这种信息损失如何与模型的泛化行为相互作用?为了弥补这一差距,本文提出了对 Jensen-Shannon (JS) 分歧和稀疏注意力机制泛化差距的系统分析。具体来说,我们首先通过 JS 散度来表征近似误差。通过截断质量 α 的基于阶统计的集中分析——其中注意力分数被假设为具有参数 sigma 的独立且同分布的亚高斯随机变量——完整注意力分布和稀疏注意力分布之间的 JS 散度被证明允许闭合形式 log 2 + ((1 - alpha)/2) log(1 - alpha) - ((2 - alpha)/2) log(2 -阿尔法)。随后,我们通过 Rademacher 复杂度推导出泛化界限,通过 O(gamma * sqrt(M/n) * (sqrt(log(3eL/M)) + sqrt(pi)/2)) 量化。此外,基于互信息的泛化界以及稀疏假设类的熵和覆盖数分析,我们获得了稀疏性相关的泛化界 O(sqrt((M/(2n)) * (log(eL/M) + log(1 + 2/epsilon))))。我们的分析表明,稀疏性降低了所考虑的假设类的复杂性,同时引入了可以通过 JS 散度量化的近似误差。这些发现提供了稀疏 Transformer 架构中信息保真度和泛化之间权衡的理论表征。