论文

自我完善往往是突然的:大型模型的启蒙式微调

Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models

模型架构Transformer

摘要

在大规模基础模型时代,对自主改进模型的追求引起了越来越多的兴趣。从人类大脑中的“启蒙”或“顿悟时刻”的概念中汲取灵感,我们假设大型模型表现出类似的启蒙现象——突然能力提升的潜在能力。然后,我们提出了 Enlightenment,一种用于大型模型的新颖的 无需训练 后调整范例。我们的方法修改了关键模块/层的快捷方式,而无需更新权重,而现有的 无需训练 主要操纵注意力权重。我们引入了两个特定于架构的实例:i)对于 大语言模型,我们提出了注意力头混合快捷方式,通过将初始注意力头的输出链接到所有其他目标头来重新校准注意力权重,并通过自适应缩放因子初始化策略进行调制。 ii)对于视觉语言模型,我们将轻量级标量调制因子应用于解码器层中的残余连接,从而调节信息流。大量实验表明,Enlightenment 有效地释放了预训练网络的潜在潜力,在不同的基准和模型上产生了显着的性能提升。