技术实践

京东云自研云原生AI推理框架落地智能调度与全场景弹性扩缩容

AI 基础设施推理服务

概述

京东云发布其自研云原生AI推理框架(配合JoyBuilder生产级平台)的体系化实践,针对传统推理系统四类瓶颈:单点故障与负载不均、静态分配导致低谷GPU闲置、长短文混排推高首字时延、多引擎接入成本高。框架做法:智能流量调度网关做长短文分桶与跨集群调度;持续刻画集群级KV Cache画像,按前缀匹配做智能路由提升缓存复用;基于排队长度与KV使用率等指标实现全场景自动扩缩容;节点标签加亲和性规则实现交换机级拓扑亲和调度;实时健康监测支撑故障自动摘流与容器自愈;统一接入层支持vLLM、SGLang无感接入;并对MoE与多模态模型做量化、引擎调优与算子开发。披露结果(压测与自述口径):Kimi-K2压测短文TTFT降90.97%、吞吐升124.46%;KV Cache命中率提升20-30%;周级节省GPU卡时5000+、利用率提升26%;DS-MoE吞吐+9%、多模态最高+39%。边界:数字为厂商压测口径。本文另含一个客户改造案例,与本条为同一框架,已按客户侧应用单独收录。