论文
ExTernD:用扩展秩三值分解逼近高精度LLM量化
ExTernD: Expanded-Rank Ternary Decomposition Ternary LLM PTQ with Accuracy Approaching Any Quantization Level
摘要
ExTernD在训练后将LLM权重矩阵A分解为B diag(D) C,其中B与C的元素取-1、0或+1,D为实数缩放向量。内部秩k=μ min(m,n)刻意超过原矩阵满秩,μ>1,使新增分量修正此前分量的量化误差。论文证明残差随k单调下降,可低于任意正ε,从而任意逼近BF16精度;固定分量数量的三值方案无法做到这一点。 内存和计算随μ连续变化,因子稀疏度随阈值τ变化,因此可以按精度目标调节,而非跳到下一位宽。在Gemma-4-E2B与Qwen3.5-4B上,以有效每权重5.2–5.5比特匹配Q4_K的逐矩阵精度,使用重要性加权时为5.1–5.5比特。完整Qwen3.5-4B转换在μ=3时取得WikiText-2困惑度10.10,相比BF16的9.78高3.2%,以约5.7有效比特接近Q4_K/Q5_K精度区间。