论文
SCALE:可扩展的交叉注意力学习与代理工作流调度的外推
SCALE: Scalable Cross-Attention Learning with Extrapolation for Agentic Workflow Scheduling
摘要
代理 大语言模型 (LLM) 系统将复杂的任务分解为工作流有向无环图 (DAG),其基元必须在异构集群上进行调度。现有的深度强化学习 (DRL) 调度程序与固定的集群大小相关,并且只要服务器数量发生变化就需要重新训练。我们提出了 SCALE(可扩展交叉注意力学习与外推),这是一种 DRL 调度程序,可以泛化到不可见的集群规模,而无需 微调。 SCALE 采用交叉注意指针网络,其中任务特征查询服务器特征,因此该架构可以通过构造接受任意数量的服务器。然而,我们观察到,仅靠排列不变架构并不能保证新规模下的良好性能——随着服务器数量的增长,注意力特征会发生分布变化。为了解决这个问题,我们引入了结构化表示正则化(SRR):去相关损失与针对标准正态的 KL 惩罚相结合,无论输入大小如何,都可以保持特征统计数据稳定。在 16 个节点上进行训练并直接在 32 和 48 个节点上进行测试,相对于没有 SRR 的相同架构,SCALE 在 N=48 时平均响应时间减少了 8.9%,这证实了显式正则化对于缩小规模泛化差距是必要的。