开源项目
LMDeploy v0.16.0:扩展多模态支持,优化FP8与SSM前缀缓存
InternLM/lmdeploy
概述
LMDeploy通过TurboMind及PyTorch后端支持模型推理和服务部署。v0.16.0新增TurboMind对InternVL与Qwen VL视觉编码器的支持,并扩展GLM-5.2、Hy3和Intern-S2-Mobius等模型兼容。版本引入Hopper上的BF16/FP8内核优化、MTP相关支持,并优化和模块化SSM前缀缓存;后者属于既有机制改进,不能表述为首次新增。部署侧拆分API端点与请求预处理,改进引导解码和部分CUDA Graph路径,同时修复跨CUDA流的输入生命周期、KV缓存量化范围及服务请求校验等问题。生产团队应按实际模型与硬件核对支持范围,不能将内核优化直接等同于统一性能提升。