技术实践

京东以xLLM和融合训练框架支撑生成式推荐

AI 基础设施模型推理应用与实践推理加速推理服务分布式训练基础设施行业应用

概述

为把 LLM 深度推理能力塞进工业级推荐的严格延迟预算,团队自建完整工程体系:训练侧基于 PyTorch 深度融合工业级稀疏嵌入引擎与 LLM 稠密训练引擎,在 128 张 H800 GPU 集群上实现 40% 的模型 FLOPs 利用率;推理侧针对生成式推荐长上下文、大候选集的特点定制 xLLM 推理框架,通过 xSchedule(系统调度)、xAttention(算子优化)、xBeam(束搜索优化)三级优化满足线上服务级别目标;指令侧由近线服务批量生成推理指令并存入 KV 数据库,线上模型直接读取,实现零在线 LLM 调用。正文仅给出训练集群、MFU 与推理引擎三级优化的具体实现,未提供代码仓库或项目主页链接。