论文
OmniOpt:现代优化器的分类、几何和基准测试
OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
摘要
大规模 模型训练 的优化器选择已成为系统级设计决策,受到计算、内存、调优预算和任务多样性的共同约束,但一百多种方法的景观仍然分散。因此,我们推出了 OmniOpt,这是一本为研究界提供的优化器统一调查和基准指南。 OmniOpt 依赖于四个耦合组件。首先,我们将每次优化器更新视为通过五阶段元管道的结构化转换,并表明大多数方法仅涉及其中的一个或两个阶段。其次,我们使用范数约束线性最小化预言(LMO)来统一不同的优化器。第三,这两种观点建立了双重分类法,一个维度将每种方法分配给一个机制系列,另一个维度记录其旨在改进的可衡量的训练目标。第四,也是本文的核心,我们在统一的跨领域基准中实例化了完整的分类法,涵盖代表性优化器、模型规模以及从语言模型预训练到图像分类的训练机制,系统地分析了跨多个效果目标的每个方法系列并列出了它们的权衡。因此,OmniOpt 为研究界提供了一个在明确机制和客观假设下选择优化器的操作坐标系,并为优化器界未来的发展指明了方向。