论文
Bayesian-LoRA:大语言模型的概率低秩适配
Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models
摘要
大语言模型通常更强调准确性,因此即使对预测不确定也会猜测,这在小数据集上微调时由于固有的失准倾向而尤为严重。在这项工作中,我们提出Bayesian-LoRA,受稀疏高斯过程启发,将确定性LoRA更新重新表述为概率低秩表示。我们识别出LoRA分解与Kronecker分解SGP后验之间的结构同构,并证明LoRA是后验不确定性坍缩时的极限情形。我们在常识推理基准上对多种LLM架构进行了大量实验。仅增加约0.42M额外参数和约1.2倍训练成本(相对标准LoRA),Bayesian-LoRA在最高30B的模型上显著改善校准,ECE最多降低84%、NLL最多降低76%,同时在分布内和分布外(OoD)评估中保持有竞争力的准确率。
