论文

关注自己的想法:通过1.58位量化的镜头打破后训练推理量化的障碍LLM

Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization

摘要

我们提出了 ScaleQ-1.58,一种用于推理 LLM 的可扩展三元 后训练 量化(PTQ)框架。其核心见解源于一项实证发现:尽管现代 LLM 通常经过训练以表现出思想链推理能力,但在 PTQ 体系中,即使是基于基于学习的可微三元化的最新 CAT-Q 方法,在使用忽略模型推理过程的传统校准方案时,仍然会导致在具有挑战性的数学和编码任务上表现崩溃。在这一发现的推动下,我们引入了一种简单的校准方法,即关注你自己的想法(AYOT),其中由预先训练的高精度目标 LLM 在一组适当的校准样本上生成的推理轨迹和最终答案以及相应的问题用作三元化过程中的上下文输入。 ScaleQ-1.58 是通过简单地将 AYOT 与 CAT-Q 集成而形成的,它展示了多种缩放特性:(1)仅使用 4M 校准词元,由 ScaleQ-1.58 三元化的 Qwen3-1.7B 就达到了先前最佳 BitNet b1.58 2B4T 在 4 个数学和编码任务上平均的性能的 90.52% 以上,并且我们的三元 Qwen3-4B 显示了绝对增益8.97%,同时量化所需的校准词元减少了 1,000,000 倍; (2) ScaleQ-1.58 很好地推广到密集架构和 MoE 架构,随着模型规模的增加(最多 235B 参数),性能也会提高; (3)ScaleQ-1.58在不同难度级别的任务中表现出很强的泛化能力,包括数学、编码和科学逻辑推理,以及常识推理和基本语言生成; (4)随着校准词元数量的增加,其性能不断提高。值得注意的是,AYOT 在其他量化位宽上也表现出强大的泛化能力。代码可在 https://github.com/IntelChina-AI/BitTern 获取。