论文
医疗领域可扩展且安全的AI推理:FastAPI与Triton Inference Server在Kubernetes上的对比基准测试
Scalable and Secure AI Inference in Healthcare: A Comparative Benchmarking of FastAPI and Triton Inference Server on Kubernetes
摘要
机器学习(ML)模型的高效、可扩展部署是现代生产环境的前提条件,在医疗和制药等受监管领域尤为如此。在这些场景中,系统必须平衡相互竞争的需求,包括为实时临床决策支持最小化推理延迟、为病历批处理最大化吞吐量,以及严格遵守HIPAA等数据隐私标准。本文对两种主流部署范式进行了严格的基准测试分析:使用FastAPI的轻量级Python REST服务,以及专用高性能服务引擎NVIDIA Triton Inference Server。借助医疗AI参考架构,我们在Kubernetes上部署了DistilBERT情感分析模型,在受控实验条件下测量中位(p50)和尾延迟(p95)以及吞吐量。我们的结果显示出明显的权衡。FastAPI在单请求负载下开销更低,p50延迟为22毫秒;而Triton通过动态批处理实现更优的可扩展性,在单块NVIDIA T4 GPU上达到每秒780个请求的吞吐量,接近基线的两倍。此外,我们评估了一种混合架构方法,即用FastAPI作为受保护健康信息去标识化的安全网关,用Triton做后端推理。本研究验证了混合模型作为企业临床AI的最佳实践,并为安全、高可用部署提供了蓝图。
