开源项目

Reame创建仓库:普通CPU上的低内存高效LLM推理

swellweb/reame

模型推理推理加速

概述

Reame独立解决普通CPU上的低内存、高效率LLM推理:让没有GPU的设备也能运行量化后的LLM,附在线演示实例可试用。仓库没有GPU但有推理需求的开发者可先体验在线演示再决定是否部署;CPU推理的速度上限受内存带宽硬约束,适合轻量任务或开发测试。