论文
GQA-μP:分组查询注意力的最大参数化更新
GQA-μP: The maximal parameterization update for grouped query attention
摘要
跨模型架构的超参数传输极大地减少了调整 大语言模型 (LLM) 所需的计算量。最大更新参数化 (μP) 确保通过原理性数学分析进行传输,但导出新模型架构可能具有挑战性。基于 Yang 等人的光谱特征学习观点。 (2023a),我们取得了两项进展。首先,我们将权重的谱范数条件从启发式提升到特征学习的定义,从而在不求助于惰性学习的情况下达到 Complete-P 深度和权重衰减缩放。其次,我们考虑一种修改后的谱范数,当权重矩阵不是满秩时,它可以保留网络权重的有效缩放定律。这使得(据我们所知,第一个)能够推导分组查询注意力(GQA)的 μP 缩放。我们通过展示 GQA 重复超参数的学习率迁移以及关于权重衰减迁移的实验来证明我们的理论推导的有效性。