论文
UpgradeBench:面向微调LLM专科模型升级的以决策为中心的基准
UpgradeBench: A Decision-Centric Benchmark for Upgrading Fine-Tuned LLM Specialists
摘要
组织会为开源权重语言模型维护任务专用适配器,而基座模型的每次新发布都迫使迁移决策:保留现有专科模型、移植适配器、从保存的行为刷新,还是重新训练。既往迁移研究评估的是孤立的模型对,未在真实模型发布序列上研究这些选择。我们提出UpgradeBench,一个决策驱动的纵向基准,覆盖连续四个Qwen发布版本、一个续训检查点、六个任务与两种模型规模,并以具有已知训练谱系的OLMo检查点加以扩充。该基准厘清三个核心问题:新检查点能否提升固定配方重训专科模型的性能、专用化资产能否跨版本迁移、以及有哪些可用的恢复资源。我们观察到升级收益因任务-规模-发布情境而异:一些重训基线提升,另一些停留在训练噪声内,其持久性从文本到SQL的不足一个发布周期到意图分类的超过十四个月不等。直接复制适配器既不依赖架构也不依赖模型家族:在OLMo上,保持率从46B token续训时的0.88-0.99降至2.9T token时的零;退火与模型汤(model souping)不引入额外损害,可移植性随续训距离衰减。在保留输入数据的前提下,教师重标注无需新的人工标准标注即可恢复目标基座专科模型,但算力节省并无保证。在33个升级情境上模拟固定决策策略,得到0.37个百分点的平均质量遗憾、零行为退化,且算力与标注成本仅为完全重训的三分之一。基于256个提示的轻量CKA探针可预测跨版本适配器可移植性(八个模型对上Spearman 0.74)。我们发布逐例预测、成本日志、划分清单与评估代码。