开源项目

InternLM/lmdeploy:正式版引入缓存量化机制并扩展服务端点

InternLM/lmdeploy

模型推理KV Cache

概述

LMDeploy 是 InternLM 团队推出的 LLM 推理部署工具箱。本次正式版本包含两类实质改动:一是新增缓存量化机制,对推理过程中的缓存进行量化以降低显存占用,支撑更长上下文或更高并发;二是扩展对外服务端点,接入方式更完整。两项改动均超出普通缺陷修复或单一后端适配的范畴,属于推理服务能力层面的增强。依赖该栈做线上推理的团队可在评估后安排升级验证。