技术实践

淘天以Attention和线性层量化加速视频生成

模型优化模型推理AI 基础设施推理加速量化模型部署

概述

为在显存规格更低的计算卡上运行高显存需求的视频生成模型,TMAP 对 DiT 权重与激活做量化:self-attention 计算全部由 16bit 量化到 8bit(SageAttention,配合层间选择性量化平抑 badcase),线性层权重 BF16→8bit 使 transformer 参数显存降低近 50%、激活近一半量化到 8bit,并把部分 W8A8 降级为 W8A16 保质量;量化后取消 CPU Offload(原每条额外耗时约 35s),单条视频生成耗时从 114s 降到 84s。