论文

高效注意力的线性代数基础:SVD 压缩下的秩崩溃的相位反转

Linear Algebra Foundations of Efficient Attention: A Phase Reversal in Rank Collapse Under SVD Compression

模型评测模型行为与机制分析

摘要

线性代数提供了现代人工智能通过神经网络编码、压缩和传播信息的概念框架(矩阵秩、奇异值分解 (SVD) 和特征分解)。本文统一了十四篇独立的同行评审作品,分析了这些技术在基于 Transformer 的基础模型研究背景下的使用,重点关注该主题的三个领域:自注意力矩阵输出秩的推导和属性、有目的地利用这种现象的压缩方法、低秩键值 (KV) 缓存投影及其与线性注意力和状态空间结构化模型的半可分离矩阵对偶性。在观察到该文献中的一个开放问题后,我们有动力进行这项工作:上述压缩方法与网络自然等级崩溃的相互作用。在本文中,我们报告了一项原始发现,即使用注意力投影的 SVD 压缩实际上对网络的排名崩溃产生相反的影响:虽然它在初始化时强烈抑制它,但它在预训练模型(GPT-2 124M、GPT-2 Medium 355M 和 Pythia-160M)上加速,出现对象混叠伪像的风险最小(在所有压缩比上验证),并且在四种排名估计方法中保持一致。对两种设置中效果的受控因果分解表明,这种行为的原因可以通过在压缩矩阵时选择 SVD 做出的子空间来解释,这比它实现的算子范数的减少更好,解释了初始化时大约 76% 的效果和预训练权重的 83%,提供了对校准感知压缩观点的改进,并解释了为什么它优于朴素 SVD 截断。