论文
用于大语言模型注意力的顺序函数结构化 Tucker 压缩
Sequential Functional Structured Tucker Compression for Large Language Model Attentions
摘要
LLM注意力的后训练压缩通常被表述为独立矩阵近似,忽略注意力投影之间的共享结构和早期压缩引入的表示偏移。我们提出了 FTC,一种顺序结构化压缩框架,它使近似值适应当前的压缩模型,同时在固定存储预算下联合利用本机 Q/K/V 头结构。输出投影是单独处理的,以考虑改变后的注意力表示。 FTC 既不需要微调,也不需要基于梯度的恢复。在从 6B 到 32B 参数的 7 个仅解码器的 LLM 中,FTC 在五个现代 GQA 模型上的每个测试保持率的比较方法中实现了最低的 WikiText-2 困惑度,并且在积极压缩下获得了最大的增益。这些改进转移到了下游任务,并且在 32B 规模上仍然很重要。