论文

以梯度历史重组实现轻量、可迁移的学习式优化器

Lightweight and Versatile Learned Optimization by Recombination of Gradient History

模型训练预训练

摘要

本文提出一种轻量且通用的学习式优化器,动态重新组合梯度历史;这些历史表示为互不重叠时间区间内的梯度均值。优化器把预测空间缩减为每个梯度均值对应的一个标量系数,由多个参数共享。对较早梯度逐步扩大平均区间,可降低长历史的存储成本,同时保留各部分独立访问能力。一个含3.7万参数、以0.87 GPU小时训练的网络,能够零样本泛化到未见任务:使BERT-Tiny与GPT-Tiny的验证损失分别降低9.1%与0.4%,使视觉Transformer测试准确率提高3.5个百分点,并在九个图模型上平均提高2.7个百分点,FLOPs额外开销最低为0.3%。

以梯度历史重组实现轻量、可迁移的学习式优化器:论文原图
图 1:将梯度历史重组为学习更新。历史贡献 −Σhαhgh-\sum_{h}\alpha_{h}g_{h} 与预测系数 αh\alpha_{h} 的重组可以将 Adam 轨迹重定向为远离上升。