论文
学习突发感知预警模型,应对超大规模数据中心 AI 工作负载激增时的容量压力
Learning Burst-Aware Early Warning Models for Capacity Stress under AI Workload Surges in Hyperscale Data Centers
摘要
大规模人工智能工作负载的快速增长,特别是 大语言模型 (LLM) 训练和推理,正在从根本上重塑超大规模数据中心的运营动态。与传统的云工作负载不同,人工智能驱动的作业表现出突发性、高强度和快速变化的资源需求,通常会导致突然的容量压力,而基于阈值的反应机制无法有效处理这种压力。在本文中,我们提出了一种面向部署的突发感知预警框架,用于人工智能工作负载激增下的主动容量压力预测。我们将该问题表述为多变量遥测窗口上的高召回率预测任务,其明确目标是在系统退化发生之前启用操作干预。所提出的框架集成了工作负载强度、时间变化和系统压力信号,并采用轻量级的基于树的学习模型来捕获高度不平衡环境中的非线性交互。为了在现实条件下评估系统,我们引入了一种人工智能工作负载激增注入方法,该方法模拟在大规模人工智能系统中观察到的突发驱动的需求模式。我们基于 XGBoost 的模型的 ROC AUC 为 0.697,AP 为 0.670,显着优于基线方法。在面向部署的阈值选择下,该框架实现了 0.914 的召回率,能够以可接受的误报成本检测大多数压力易发期。除了预测性能之外,我们还展示了如何将所提出的框架集成到操作控制循环中,以支持工作负载限制和资源扩展等主动操作。我们的结果凸显了高召回率、基于学习的预警系统在人工智能驱动的工作负载时代实现弹性和自适应数据中心运营的实用价值。