将 FP8 质量上限保持在 8 位权重和激活:INT8 和 GGUF 后训练 消费类 GPU 的 Ideogram 4.0 量化
Holding the FP8 Quality Ceiling at 8-Bit Weights and Activations: INT8 and GGUF Post-Training Quantization of Ideogram 4.0 for Consumer GPUs
摘要
我们研究了 Ideogram 4.0 的 后训练 量化 (PTQ),这是一种 9.3B 流匹配扩散 Transformer (DiT),它通过单流主干的两个独立权重副本实现无分类器引导,并由 Qwen3-VL 文本编码器调节,针对缺乏 FP8 张量核心的 Ampere RTX~3090 GPU。由于 Ideogram~4.0 是在结构化 JSON 图像描述上进行训练的,因此我们在由根据 Ideogram 发布的图像描述规范构建的 LLM 扩展器生成的模式有效 JSON 提示下评估每个变体,并使用跨越人类偏好 (HPSv2)、CLIP 和 PickScore 等一组评测指标对它们进行评分,以实现独立质量; PP-OCR 文本精确匹配和编辑距离;以及 PSNR/SSIM/LPIPS,以保真 FP8 参考(最高精度的公共检查点)输出。在具有配对引导置信区间的 300 提示基准上,INT8 W8A8 配方(每个通道权重、每个词元动态激活、SmoothQuant 和小型高脆弱性层集的 bf16 保护)在 CLIP 和 PickScore 上与 FP8(配对 CI 包括零)在统计上无法区分,并且在 ~0.004 HPSv2 范围内,并且在其 8 位大小下,是最FP8 输出的忠实再现(半长 4 位基线的 LPIPS 0.243 与 0.277/0.306;INT8-Q4_K 间隙不包括零)。 GGUF Q4_K 量化在相同的磁盘大小下达到与已发布的 NF4 基线相同的独立质量,使其成为质量内存前沿的帕累托选择。我们进一步表明,在 JSON 提示下,所有四个变体在独立质量上都达到了同等水平,这些变体在保真度和文本渲染上分开,而不是在总体图像质量分数上分开,并且当使用原始字符串提示模型时,文本易读性接近于零,在它期望的 JSON 标题下达到 55% OCR 精确匹配。我们在封闭的非商业许可下在 Hugging Face 上发布了 INT8 W8A8 和 GGUF Q4_K 量化权重。