技术实践
Snowflake基于vLLM优化模型在线推理服务
概述
背景与问题:客户想在生产中使用开源或自有微调模型,却要自行承担GPU基础设施管理、推理引擎优化与数据边界防护的重活。方案与落地:Snowflake ML的Model Serving面向自带模型团队,继续押注vLLM这一高吞吐、省显存的推理引擎,用PagedAttention与continuous batching动态管理GPU显存,支持流式输出;模型经OpenAI兼容协议暴露,SQL、Python、REST均可调用;新增从Hugging Face一键导入与远程登记大模型,推理参数运行时可动态调整。安全上,推理负载运行于Snowpark Container Services的气隙容器内、不出账户边界,官方称经协同优化内部路由后,冷启动下载700GB模型仅需83秒、持续网速67.5Gbps。效果与数据:官方基准(Qwen3-4B等架构)称P99延迟与TTFT较Databricks平均优2.2-2.3倍,对Baseten在各并发下均占优,700GB的GLM 4.5在H200节点上扩展良好;博客注明基准为单节点、部分在内部环境完成,实际结果因负载与区域而异。计费按资源而非token。