论文

LoRA-Muon:低秩流形上的谱最速下降

LoRA-Muon: Spectral Steepest Descent on the Low-Rank Manifold

模型训练参数高效训练

摘要

LoRA降低微调算力与内存成本,但使用AdamW等按因子更新的优化器时,对初始化敏感,最佳学习率难跨秩迁移,且常不能超过全参数训练。LoRA-Muon将Muon的谱最速下降规则用于低秩场景,并配合拆分权重衰减,作为全秩Muon及Shampoo系列优化器的低秩代理。其最佳学习率可跨秩、宽度、深度及因子重缩放迁移。在算力匹配的TinyShakespeare实验中,秩2代理找到了全参数设置中测试过的最佳学习率,秩32配置在多随机种子平均扫描中获得更低平均验证损失。研究还指出Spectron依赖任意因子缩放,可能不适合从严重不平衡因子开始微调;LoRA-RITE简化QR坐标核心实现同样的谱更新。LoRA-Muon无需QR分解,也无需存储二阶矩,更利于加速器执行与内存效率。