技术实践
腾讯Ray团队建KubeRay联邦的故障感知隔离恢复闭环
概述
腾讯TEG数据计算平台部的Ray团队,需要支撑内部多模态数据处理与大规模强化学习训练——这类负载跑在生产环境上百个物理集群上,CPU与GPU资源分离管理。团队在腾讯峰峦K8s底座上建设Ray平台,并实施KubeRay联邦协同管理多集群。故障处理形成闭环:训练故障可经Ray Dashboard接口统一标记;当任务无法推进并触发重启时,系统自动替换已标记的故障节点,在K8s层屏蔽故障GPU卡,并让新任务调度自动避开已知故障节点——感知、隔离与恢复三段衔接。运营大规模Ray训练集群的团队可参考其“标记—替换—屏蔽—避让”的故障闭环设计;该方案绑定腾讯内部底座,复现需按自有K8s环境适配。 同一实践的腾讯云开发者披露还说明了CPU/GPU分离资源条件下的跨层弹性调度,以及从Virtual Kubelet接入到KubeRay联邦管理的架构调整。联邦管理与故障处置属于同一团队、同一Ray平台的工程能力,不分别拆成多条案例。