论文

用于极低位 LLM 量化的受影响启发的光谱旋转

Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization

摘要

我们将配套理论论文 (arXiv:2605.01637) 的影响自适应沃尔什几何应用于极端低位仅权重 LLM 量化。配方是一种数学不变的变换:WHT 旋转每个线性层的权重矩阵,并通过每个坐标沃尔什基激活能重新调整其列,然后传递到重建误差量化器(英特尔自动舍入)。这使得每组整数舍入偏向于高光谱能量通道。在四个从 135M 到 1.5B 参数的预训练解码器模型上,相对于 W2A16 的普通自动回合,BBT-spectral 将 wikitext-2 困惑度降低了 15-58%;我们还报告了 TinyLlama-1.1B 辅助数据点。三个扩展将配方转移到了它失败的家族:q_norm/k_norm 的每头 PCA 矩阵 Gamma 替换用于 Qwen3 注意力(Qwen3-0.6B 上的 PPL 136.76 -> 88.99);与 RoPE 交换的 SO(2) 每对旋转(Qwen2.5-1.5B 上的 PPL 36.93 -> 21.84);以及通过拉古纳风格融合专家布局的架构模糊测试确定的 MoE 感知输入侧吸收修复。 W2-vs-W4 消融提供了有意的负控制:重新分配收益落在 W4 的 +/-0.5 PPL 噪声基底内,这与 Schur 凸性直觉一致,即随着噪声预算的缩小,不集中影响的成本消失。所有量化权重均导出至 OpenVINO IR,并在 Intel NPU + Arc dGPU + CPU 上运行,PPL 与设备保持不变,误差范围为 +/-0.1。我们并不要求理论论文的主化论证进行正式的布尔到实值的转移:这里使用的 WHT 激活能不是理论论文的布尔影响,这种联系是直观的,并且贡献是工程价值而不是转移定理。未来的主要工作项目是在匹配校准中与 SpinQuant、QuaRot、QuIP-sharp、AQLM、OmniQuant 和 ButterflyQuant 进行头对头基准测试。