论文

TopoTuner:大语言模型的拓扑微调

TopoTuner: Topological Finetuning of Large Language Models

模型训练参数高效训练

摘要

全量微调仍是适配预训练LLM的强方法,但它更新所有权重、成本可能很高。LoRA减少可训练参数量,却没有直接回答适配时哪些预训练组件应训练、哪些可以冻结。我们提出TopoTuner,一个以拓扑为导向、对注意力投影矩阵做选择性冻结的微调框架。TopoTuner把每个投影矩阵视为行云,用持久图之间的Wasserstein距离度量其在微调过程中的拓扑变化;从源数据集学习一个可复用的冻结配置,再迁移到域外数据集上高效微调模型,并评估任务特定的拓扑漂移能否在问答与情感分析任务间泛化。在LLaMA-3.1-8B、Mistral-7B-v0.3与Qwen3-8B-Base上,TopoTuner仅训练1–2%的模型参数即与全量微调有竞争力,在9个模型—数据集设置中的7个优于LoRA——后者可能改动多达39.57%的投影参数。除最小化更新外,TopoTuner相对全量微调平均减少20.4%训练时间、相对LoRA平均减少5.5%。TopoTuner开启了可复用冻结配置的新方向:在一个数据集上学到的微调行为可以跨多个任务共享。

TopoTuner:大语言模型的拓扑微调:论文配图
图 1:高漂移 Wasserstein 冻结(33 至 1515 层)下的 LLaMA OO 投影变化。随着更多的矩阵在训练过程中被冻结,剩余的可训练矩阵以更集中的方式吸收更新;选择性冻结在各层之间重新分配适应性。