技术实践

腾讯 TEG-Ray 团队基于 Ray 重构混元数据管道并落地万卡规模

AI 基础设施数据基础设施

概述

腾讯TEG-Ray团队将混元数据管道重构到Ray异构融合底座上。背景:AI数据管道本质是批量推理,上一代Spark、Flink加远程打标服务的架构系统孤岛、算力分散难统一调度。做法:调度层选KubeRay联邦方案,实现跨上百个K8s物理集群的单RayCluster组网,CPU与GPU经同一入口组网;计算层选Ray Data的streaming-batch范式,把数据处理与模型推理融进一个任务。容错上增加Task/Actor调度超时、节点故障检测、Actor黑名单与Checkpoint断点续算;为承接弹性卡、混部卡等不稳定资源,改造为存算分离:各stage的Actor池驻留在约5%稳定资源上缓存中间数据,推理算子跑在不稳定资源上,自述高优卡任务性能零回退。利用率方面做冷启动预热、序列化合并、复合算子拆分(某视频算子GPU利用率从20%提至70%以上);单集群准入半年内从500节点/1万Actor扩至2000节点/4万Actor。自述收益:半年重构10余条管线、万卡生产化;音频管线节省90% GPU卡,多模态理解管线GPU利用率提升3倍以上,整体研发效率提升1–3倍。以上均为团队自述。