论文
以梯度历史重组实现轻量、可迁移的学习式优化器
Lightweight and Versatile Learned Optimization by Recombination of Gradient History
摘要
本文提出一种轻量且通用的学习式优化器,动态重新组合梯度历史;这些历史表示为互不重叠时间区间内的梯度均值。优化器把预测空间缩减为每个梯度均值对应的一个标量系数,由多个参数共享。对较早梯度逐步扩大平均区间,可降低长历史的存储成本,同时保留各部分独立访问能力。一个含3.7万参数、以0.87 GPU小时训练的网络,能够零样本泛化到未见任务:使BERT-Tiny与GPT-Tiny的验证损失分别降低9.1%与0.4%,使视觉Transformer测试准确率提高3.5个百分点,并在九个图模型上平均提高2.7个百分点,FLOPs额外开销最低为0.3%。
