论文
激活感知权重张量化:大模型压缩的校准预调节
Activation-Aware Weight Tensorization: A Calibration-Time Preconditioner for Tensor-Network LLM Compression
摘要
训练后张量网络压缩用张量训练 (TT) 或树张量网络 (TTN) 运算符替换 Transformer 线性层,但标准分解可最小化权重空间 Frobenius 误差,而不是层激活分布下的函数误差。我们提出了激活感知权重张量化(AWT),这是一种免训练的校准包装器,它在未更改的 TT/TTN 求解器之前使用对角激活衍生尺度对每个权重矩阵进行预处理,并仅通过输入侧元素重新缩放来部署结果。在 Llama 3.1 8B、Ministral 8B 和 Qwen2.5 7B 中,AWT 在 2-6 倍压缩下持续改进普通 TT/TTN 张量化:在单算子替换下,AWT 在三个模型系列和 2-6 倍压缩设置下将 WikiText 困惑度差距缩小到密集基线的 12-35%;而在多算子 Llama 后缀替换下,它在注意力组和全七矩阵设置中关闭了 27-60%。这些成果还转移到了下游 HellaSwag 和 ARC-Challenge 评估。我们进一步证明对角线 预处理是鲁棒性-模块化的权衡,而不是对角协方差假设:密集的全协方差预言在 80/81 的情况下赢得了自己的加权目标,而对角 AWT 在 53/81 的情况下提供了更好的保留功能保真度。总之,这些结果将 AWT 定位为一种有原则的模块化预处理器,用于在不修改分解求解器的情况下提高固定 TT/TTN 压缩管道中的功能保真度。