技术实践

Snowflake ML团队以统一基准优化实时模型服务低延迟推理

AI 基础设施推理服务

概述

Snowflake ML工程团队发文介绍其模型服务的性能优化实践。为让优化可度量,团队先搭统一实验框架,覆盖XGBoost决策树、Sentence Transformer嵌入模型与Gemma等LLM多种类型;正文以常用的all-MiniLM-L6-v2为例展开:模型跑在GPU_NV_M计算池(每节点4张A10G),num_workers设为8,四张GPU由八个worker分用、每卡复制两份;每请求只送单行以模拟实时交互推理,延迟从Snowflake网络边界外的客户端测量端到端P99,并剔除首批请求以排除冷启动。优化思路包括把请求处理、序列化等CPU与内存密集操作同GPU推理分离以解决资源错配、精细线程管理、无等待动态批处理与请求流水线化。文中给出的基线示例:8并发以内P99约40毫秒,第9个并发请求因全部worker占用导致P99额外跳升约40毫秒,暴露简单Gunicorn方案的扩展瓶颈。边界:为厂商自述基准而非第三方评测,正文节选未汇总给出优化后的最终收益数字。