论文
通过 Fisher 的视角理解 LLM 参数更新稀疏性
Understanding LLM Parameter Update Sparsity through the Lens of Fisher
摘要
最近的研究发现,语言模型训练后的参数变化可能集中在一小部分坐标中。这种现象已在强化学习、on-policy蒸馏和近策略数据的监督微调中得到报道。它在不同的训练后范式中的重复出现表明训练动态的共享结构。在本文中,我们通过对角线模型 Fisher 来检查这种模式,该模型测量模型输出分布对各个参数的敏感性,并且独立于任何特定的奖励或教师信号。从理论上讲,我们表明小对角费舍尔会导致一系列训练目标的预期梯度较小,从而为稀疏梯度更新提供了常见的解释。根据经验,我们在 RL 和 OPD 中测试了这种连接。我们发现 Fisher 识别出梯度集中的位置,并且从初始 Fisher 中选择的固定稀疏掩模保留了完整训练的很大一部分改进。最后,我们研究了on-policy训练中低费舍尔的潜在机制。我们的结果表明,高概率的下一个标记往往具有相似的参数敏感性,从而导致费舍尔值较低。总之,这些结果将费舍尔对角线模型作为一个统一的视角,将更新稀疏性与大语言模型后训练的在政策训练动态联系起来。