论文
DeInfer:分解 大语言模型 的高效并行推理
DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models
摘要
现有的 大语言模型 (LLM) 分解工作主要集中于提高下游任务的性能,但在尝试扩大模型大小时忽略了较差的并行推理性能。为了缓解这一重要的性能问题,本文引入了 DeInfer,这是一种高性能推理系统,专用于分解的 LLM 的并行推理。它由多项优化组成,可最大限度地提高性能并与最先进的优化技术兼容。我们进行了大量的实验来评估DeInfer的性能,结果证明了它的优越性,表明它可以极大地促进分解的LLM的并行推理。