论文
bf16 导出可能撤销三元语言模型的大部分微调改动
Lost in the bf16 Cast: Exporting Ternary Language Models Can Revert Most Low-Learning-Rate Code Changes
摘要
BitNet b1.58、Falcon-E和BitCPM等三元语言模型以高精度潜在权重微调,再导出三元量化码部署;实验室文档中的导出流程先将潜在权重转为bf16。我们审计三家流程。发布检查点中,直接对所发潜在权重作fp32量化,与部署量化码在Falcon-E和BitCPM中有0.83%—1.77%不一致,BitNet 2B-4T为1.530%。前两者多数差异来自bf16舍入恰落在阈值,再由偶数舍入规则映射为零;未修改的onebitllms导出器能逐字节复现四个Falcon-E版本。选取名义学习率与bf16 ULP比例匹配的微调终点,文档导出使Falcon-E-1B-Base的贪婪GSM8K严格准确率从58.79%降至0.78%,BitCPM-CANN-0.5B从36.13%降至0.39%;bf16保存再加载使BitNet 2B-4T严格准确率下降27.54个百分点,尽管末尾数字准确率上升。直接写出训练量化器的量化码,或调整bf16输入使原工具输出这些码,两种兼容修复在三个模型均满足相对在线评测的4个百分点严格准确率非劣标准。在两模型族中,随机干预初始距阈值距离,支持微调改变哪些量化码取决于该距离。