论文

Bayesian-LoRA:大语言模型的概率低秩适配

Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models

模型训练参数高效训练

摘要

大语言模型通常更强调准确性,因此即使对预测不确定也会猜测,这在小数据集上微调时由于固有的失准倾向而尤为严重。在这项工作中,我们提出Bayesian-LoRA,受稀疏高斯过程启发,将确定性LoRA更新重新表述为概率低秩表示。我们识别出LoRA分解与Kronecker分解SGP后验之间的结构同构,并证明LoRA是后验不确定性坍缩时的极限情形。我们在常识推理基准上对多种LLM架构进行了大量实验。仅增加约0.42M额外参数和约1.2倍训练成本(相对标准LoRA),Bayesian-LoRA在最高30B的模型上显著改善校准,ECE最多降低84%、NLL最多降低76%,同时在分布内和分布外(OoD)评估中保持有竞争力的准确率。

Bayesian-LoRA:大语言模型的概率低秩适配
图5:ARC-Easy 数据集上的 Pareto 分析(ACC 对 NLL 以及 ACC 对 ECE)。每个点表示一对超参数 (lr, wd)。灰色区域显示被支配的解,十字标记靠近 Pareto 前沿的“Best choice”。