论文
衍射:LLM 域适应的光谱视图
Diffract: Spectral View of LLM Domain Adaptation
摘要
我们研究连续的 预训练 (CPT) 作为一种将通用 大语言模型 适应专业领域的机制:数学、指令、代码和自然文本。使用权重矩阵的奇异值分解,我们发现 CPT 使奇异值谱很大程度上保持不变,自适应主要由奇异向量的变化驱动。对注意力头部投影矩阵的分析揭示了强烈的、依赖于领域的头部异质性,我们利用它来定义头部重要性标准:可以删除高达 60% 的头部更新,而不会造成可测量的质量损失。与完全训练的基线相比,有选择地将低重要性头回退到其预训练状态可将基准准确性提高高达 4%。最后,我们确定了域连接性(CPT 检查点之间的线性插值可产生平滑的域质量插值,而不会在任一域上出现显着退化),并发布 Diffract,这是一个用于十亿参数模型的可扩展谱分析的开源工具包。