论文
MedCL-Bench:生物医学持续学习中稳定性-效率权衡与扩展的基准测试
MedCL-Bench: Benchmarking stability-efficiency trade-offs and scaling in biomedical continual learning
摘要
医学语言模型必须随证据与术语的演进而更新,但顺序更新可能触发灾难性遗忘。尽管生物医学 NLP 已有许多静态基准,但在标准化协议、对任务顺序的鲁棒性以及考虑计算成本的报告方式下评估持续学习的统一、任务多样基准尚不存在。我们提出 MedCL-Bench,它以流式方式呈现横跨五个任务族的十个生物医学 NLP 数据集,在八种任务顺序下评估十一种持续学习策略,并报告保持率、迁移率与 GPU 小时成本。在不同骨干模型与任务顺序下,对新任务的直接顺序微调会引发灾难性遗忘,导致更新后在先前任务上出现性能回退。各持续学习方法处于不同的保持-计算前沿:参数隔离在每 GPU 小时上提供最佳保持率,重放在更高成本下提供强保护,而正则化的收益有限。遗忘具有任务依赖性,多标签主题分类最易受损,而受约束输出类任务更为稳健。MedCL-Bench 为部署前审计模型更新提供了可复现的框架。
