技术实践
Baseten 用 NVIDIA Blackwell 扩展 AI 推理服务规模
概述
Baseten 是为 AI 应用提供推理云服务的公司,聚合十余家云提供商的 GPU 形成统一资源池,可在五分钟内调度数千块 GPU。随着推理模型兴起,思考类输出拉长了单次推理时间,成本与时延压力上升。NVIDIA 官方案例披露,Baseten 率先在 Google Cloud 上采用配备 Blackwell GPU 的 A4 虚拟机,并配合 Dynamo 推理框架与 TensorRT-LLM,承接对内存、算力和上下文长度要求更高的大模型服务。官方披露的效果包括:同等 GPU 数量下,定制模型可服务的用户请求量提升至原来的 5 倍;服务 DeepSeek R1 与 Llama 4 时性价比最高提升 225%;DeepSeek-R1 等最大型模型的推理时延最多降低 38%。文中提到迁移到 HGX B200 之前,团队曾在大推理模型的用户时延与成本之间艰难权衡。上述数字为 NVIDIA 与 Baseten 自述口径,多带至多、最高等限定,未披露具体测试负载、批量规模与模型配置,横向比较时需留意条件。