技术实践

Snowflake 自研基于 Snowpark Container Services 的模型在线推理服务

AI 基础设施推理服务

概述

这是 Snowflake 机器学习工程团队的自身工程实践,属于产品基础设施的架构分享。Snowflake ML 的模型注册表是模型管理与部署的集中入口,团队在此基础上构建了可扩展的在线推理服务,同时覆盖批量与在线两类负载。其核心体验是:模型注册后,用户调用一次 create_service 或在界面点击,即可得到生产可用的推理端点,其余环节由平台自动完成——包括识别并打包模型代码、权重与依赖的制品解析,按模型类型选择基础镜像(GPU 模型配 CUDA 兼容镜像、CPU 模型用更轻量镜像),构建面向低延迟的推理运行时,并借助层缓存加速后续构建。部署参数支持计算池指定、实例数上下限与自动挂起等配置,用户仍可定制 GPU 预留与节点内并行度。文章还给出控制器与引擎两层服务架构的设计取舍。作为架构说明,文中未披露性能基准或客户效果数字,内容为厂商自述口径。