论文

适用于 CPU 的 Litespark 推理:适用于三元(1.58 位)语言模型的超快速 SIMD 框架

Litespark Inference For CPUs: Ultra-Fast SIMD Framework for Ternary (1.58-bit) Language Models

模型推理推理加速

摘要

大语言模型 (LLM) 已经改变了人工智能,但其计算要求对于大多数用户来说仍然令人望而却步。标准推理需要昂贵的数据中心 GPU 或云 API 访问,导致超过 10 亿台个人计算机未充分利用人工智能工作负载。三元模型提供了一条前进的道路:它们的权重被限制为{-1,0,+1},理论上消除了浮点乘法的需要。然而,现有框架未能利用这种结构,将三元模型视为密集浮点网络。我们通过定制 SIMD 内核来解决这一差距,该内核用简单的加法和减法运算取代矩阵乘法,针对现代 CPU 上可用的整数点积指令。我们的实现 Litespark-Inference 可通过 pip 安装,并直接与 Hugging-Face 集成,与 Apple Silicon 上的标准 PyTorch 推理相比,吞吐量提高了 18.15 倍,首次生成词元的时间加快了 7.15 倍,内存减少了 6.03 倍,而在 Intel 和 AMD 处理器上吞吐量加速可比或更高,高达 95.81 倍。