论文
将 后训练 三元化扩展到 Qwen3-8B 能力保留、复制、无损打包和打包执行
Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution
摘要
超低位语言模型有望减少存储和内存流量,但名义上的“1.58 位”标签并未指定部署的表示或其执行成本。我们研究了从 Qwen3-4B 到 Qwen3-8B 的激进 后训练 转换管道的扩展。该转换在仅重量 A16 配置中使用 KOTMS 旋转、E2M-ATQ 自适应三元化和 GPTQ 式误差补偿。我们并不认为这些算法是新的。我们的贡献是端到端的扩展表征:外部复制门、匹配的 4B/8B 能力分析、跨语料库困惑、有效位计算、无损格感知打包和直接打包执行。 8B 模型的三语料库困惑度比率为 1.361x,WikiText-2、C4 和 PTB 比率分别为 1.318x、1.393x 和 1.371x。在 n = 500 的八个零样本任务中,平均准确度为 64.6%,而 FP16 为 72.4%,对应于 78.5% 的机会校正保留率和 7.8 分的绝对成本。匹配的 4B 运行保留了 69.6%,比 8B 领先 8.9 分。打包的检查点大小为 8.24 GiB,并保留了记录的测量精度困惑度。直接打包执行速度在 7.35 GiB 中达到 15.52 个词元/秒,而初步打包的 GEMV 仍然慢于 FP16 cuBLAS。结果是经过验证的扩展基线:模型大小提高了对激进的 后训练 离散化的鲁棒性,针对测量的工件解决了实际序列化问题,并且直接执行是可行的,同时更广泛的种子、校准分布和内核优化仍然开放。