论文
量化目标,量化起草者:使用 Qwen3.5-4B 进行高效推理
Quantize the Target, Quantize the Drafter: Efficient Inference with Qwen3.5-4B
摘要
本报告介绍了我们进行高效 Qwen 竞赛的方法,其目标是在资源有限的 NVIDIA A10G GPU 上实现 Qwen3.5-4B 的低延迟服务。我们的系统将量化目标模型与 推测解码 相结合。为了恢复准确性,我们将量化感知 蒸馏 应用于目标模型,同时保留原始量化网格。为了加快解码速度,专门用于量化目标模型的块扩散绘图器使用两阶段过程进行训练:首先从高精度目标中学习,然后适应低精度目标。由于起草器在每个 推测解码 步骤中都会被调用,因此我们通过量化和滑动窗口注意力进一步减少了其开销,保留草稿词元接受,同时改善长上下文解码延迟。结果,我们提交的内容比基线平均加速了 6.978$\times$,同时满足了所需的质量阈值,整体排名第三。我们希望这些结果为实际的 LLM 推理提供有用的见解。代码和资源可在 https://github.com/nota-github/adaptfm-quant-dflash 获取