论文
LLM中的超级权重和选择性训练的失败
Super Weights in LLMs and the Failure of Selective Training
摘要
最近的工作确定了超级权重,即单个参数,删除这些参数会使模型性能降低几个数量级。我们表明,由于修剪超级权重而导致的这种退化并不普遍适用于所有 LLM。此外,如果这些参数如此重要,超级权重意识训练应该是有效的。我们展示相反的情况。单独训练超级权重(100 到 8,192 个参数)会将 OLMo-1B 和 OLMo-7B 上的准确性降低到随机猜测水平,并且扩展到最多 36K 参数的局部邻域也没有任何改进。该失败特定于超级权重坐标:在相同的 down_proj 层中训练相同数量的随机选择的位置,而不是在基线上进行改进,因此崩溃来自于针对超级权重,而不是稀疏性本身。 Vanilla LoRA 通过低秩结构更新注意力权重矩阵中的每个位置,只用了 0.16% 的参数就成功了,并且对 down_proj 应用相同的低秩更新也成功了。 10 种子消融证实,在对应于超权重坐标的位置限制 LoRA 更新会产生统计上无法区分的结果。这些发现表明,参数重要性并不意味着孤立的参数可训练性,并且有效的 微调 依赖于整个层的结构化分解,而不是针对单独的重要权重。