论文

Qwen3-4B的后训练三值化:能力、有效比特预算、存储压缩与部署

Post-Training Ternarization of Qwen3-4B Capability, Effective Bit Budget, Storage Compression, and Deployment

摘要

超低位语言模型可以减少存储和内存带宽,但名义上的“1.58 位”标签并不能完全描述存储的表示、保留的功能或运行时行为。我们使用 KOTMS 旋转、E2M-ATQ 三元化和 TWLA 的 GPTQ 式误差补偿来研究 Qwen(一种指令调整的 4B 参数模型)的端到端训练后转换。该实验仅考虑权重:激活保持 16 位精度,因此省略了 ILA-AMP。我们评估有效的比特核算、任务能力保留、困惑度、校准灵敏度、检查点组成和部署行为。最终转换使用每个权重 1.641 个有效位进行量化线性权重,目标是 81.62% 的模型参数。在 10 项评分能力比较中,准确度从 64.5% 下降到 54.7%。降级是不均匀的:BoolQ 保留了 84.6% 的机会校正教师表现,而 ARC-Challenge 保留了 43.8%。 WikiText-2 上的困惑度从 13.639 上升到 18.748,PTB 上的困惑度从 24.700 上升到 31.992,C4 上的困惑度从 19.831 上升到 28.966。随后的打包运行保留了三元平面和尺度,将报告的模型大小从 8.29 GiB 减少到 3.96 GiB,而困惑度基本不变。单独的第三方打包尝试是有损的,并且被排除在主要工件声明之外。打包的工件尚未针对任务准确性或生成吞吐量进行端到端基准测试。在一种测试形状上,初步的 Triton GEMV 微基准测试比 FP16 cuBLAS 慢 4.6 倍。因此,我们并不声称仅压缩就能产生更快的推理。

Qwen3-4B的后训练三值化:能力、有效比特预算、存储压缩与部署:论文配图
图2:三个公司的情况令人不解。WikiText-2 是校准分布; PTB 和 C4 提供分配以外的检查。