论文

持续校准:覆盖范围可能会在终生精度之前崩溃 LLM 微调

Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning

模型训练持续学习

摘要

大语言模型 的持续学习通常通过连续 微调 下的准确性保留进行评估。我们认为这种观点是不完整的,因为不确定性可靠性可能比 top-1 性能更早、更严重地下降。我们通过测量三个模型系列和主要来自分类和多项选择基准的八个任务序列的连续微调模型的保形覆盖率和校准误差来实证研究这一点。在我们研究的分类风格设置中,种子的覆盖率损失平均超过准确性损失大约 \(3.4\times \pm 0.5\times\) 倍;在最明显的情况下,覆盖范围从 \(0.92\) 下降到 \(0.61\),而准确度仍保持在基线的三个点以内。保持准确性的标准持续学习方法不会自动保持覆盖范围,并且朴素的校准基线仅恢复部分差距。我们提出校准重放,这是一种轻量级的事后程序,它维护特定于任务的保留缓冲区,并在每次更新后在当前模型下重新调整特定于任务的共形阈值。它不增加训练时间梯度成本,使用的内存不到普通体验重放的百分之一,并且通常在缓冲区大小 \(m = 200\) 时将覆盖范围恢复到标称值的两个点以内。我们通过漂移分解、显示可交换性下精确保形有效性的有限样本恢复定理以及解释为什么合并阈值不够的混合有效性命题来配合实证研究。我们的保证是针对具有特定任务缓冲区的分类式任务;开放式一代的扩展是探索性的。