论文

ALTO:异构 LoRA 训练工作负载的自适应 LoRA 调整和编排

ALTO: Adaptive LoRA Tuning and Orchestration for Heterogeneous LoRA Training Workloads

AI 基础设施分布式训练基础设施

摘要

低秩适应(LoRA)现在是 大语言模型 参数高效 微调 的主要方法,但实现高质量适配器通常需要系统的超参数调整,因为 LoRA 性能对配置选择高度敏感。实际上,这会导致许多并发 LoRA 作业,通常跨越多租户环境中的异构任务。现有系统在很大程度上独立处理这些工作,这既浪费了弱候选者的计算量,又导致 GPU 未得到充分利用。我们推出了 ALTO(自适应 LoRA 调整和编排),这是一种共同设计的训练系统,可加速 LoRA 超参数调整,同时实现跨异构任务的高效集群共享。 ALTO 背后的核心见解是,当多个调优作业在共享的冻结主干上同时运行时,它们会暴露出单作业设计无法利用的优化机会。在此基础上,ALTO 监控丢失轨迹以尽早终止无希望的配置,使用融合分组 GEMM 和新的rank-local适配器并行机制来共同定位幸存的适配器并回收释放的 GPU 容量,并结合任务内和任务间调度,通过利用 LoRA 作业的可预测持续时间来改善多任务放置。广泛的评估表明,在不牺牲适配器质量的情况下,ALTO 比最先进的技术实现了高达 13.8 倍的加速。