论文
使用 PyTorch Native Stack 在服务器 CPU 上对小型 NLP 模型进行高效 INT8 推理
Efficient INT8 Inference of Small NLP Models on Server CPUs with PyTorch Native Stack
摘要
即使在 大语言模型 时代,小型 NLP 模型,尤其是 BERT 系列编码器,在分类、排序和检索等工业工作负载中仍然很重要。在服务器 CPU 上,INT8 量化提供了有吸引力的延迟-吞吐量-成本权衡,但用户越来越期望这种加速能够直接在本机 PyTorch 堆栈中提供。我们将 SmoothQuant 集成到 TorchAO 中,并通过 TorchInductor 中的图形级融合以及跨基于 oneDNN、AVX512_VNNI 和 AMX 的实现的高效 INT8 GEMM 内核选择来优化英特尔至强 CPU 的推理路径。在 BERT、DistilBERT 和 XLM-RoBERTa 基准测试中,该方法可实现高达 5.8 倍的端到端吞吐量加速,并且相对于 FP32 基准,精度损失可以忽略不计(在某些情况下无法测量)。我们还通过屋顶线模型的详细性能分析来验证我们的工作。该实现已上游至 PyTorch 和 TorchAO,支持使用本机 PyTorch 工具进行开箱即用的部署