论文
不是维度,而是规范:语言模型的无梯度权重扰动中重要的是什么
Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
摘要
让语言模型适应任务不再需要训练其所有权重,一系列参数高效的方法已将可训练数量从数十亿减少到几个标量。无梯度自适应对随机权重扰动进行采样并保留得分较高的扰动,但它并未遵循该轨迹,并且仍然扰乱权重张量的每个条目。目前尚不清楚全权重搜索是否必要,更根本的是,扰动的哪种属性使其发挥作用尚不清楚,因为现有方法改变了搜索空间、扰动尺度和聚合。我们通过在固定管道内一次干预一个因素来解决这个问题,在改变搜索维度、携带扰动的子空间及其范数的同时,保持候选人评分和投票不变。扰动 12 到 16 个标量的冻结框架在 49 个模型基准单元中平均比全权重搜索落后 1.8 个精度点,其中 36 个单元落后于全权重搜索。维度和基础的选择都无法解释这种性能。一旦匹配了单个比例因子,格拉斯曼与 SVD 框架在机会水平上重叠的随机框架就会表现相同,并且在大比例下,SVD 方向首先崩溃。幸存下来的是扰动范数,其可用范围在七个模型中接近五分之一,并且内部保持平坦。因此,扰动范数是失效模式的唯一因素,并且其安全区域跨规模和族转移。设计问题从扰动哪个子空间缩小到扰动的难度。