论文

HCInfer:针对资源受限设备的通过误差补偿的高效推理系统

HCInfer: An Efficient Inference System via Error Compensation for Resource-Constrained Devices

AI 基础设施推理服务

摘要

由于参数大小巨大,LLM 在消费级硬件上经常会遇到内存受限的部署。虽然模型压缩和卸载等现有解决方案提高了部署可行性,但它们通常会遇到精度大幅下降或严重的吞吐量瓶颈的问题。最近的误差补偿方法通过辅助 LoRA 式分支恢复精度,我们观察到这些分支本质上适合卸载:它们需要大量参数存储,但在每个推理步骤期间仅访问补偿参数的一小部分。受此机会的启发,我们提出了 HCInfer,这是一种异构推理系统,可在 GPU 上执行压缩主干的同时将剩余补偿卸载到 CPU,并进一步引入异步补偿管道和敏感度感知动态排名分配,以隐藏补偿开销并最大限度地提高精度恢复。实验结果表明,与压缩模型相比,HCInfer 在下游任务上实现了最大 5.2% 的精度提升,与全精度模型相比,保持了 10.4 倍的最大加速。