论文

MedCL-Bench:生物医学持续学习中稳定性-效率权衡与扩展的基准测试

MedCL-Bench: Benchmarking stability-efficiency trade-offs and scaling in biomedical continual learning

模型评测基准与评测资源

摘要

医学语言模型必须随证据与术语的演进而更新,但顺序更新可能触发灾难性遗忘。尽管生物医学 NLP 已有许多静态基准,但在标准化协议、对任务顺序的鲁棒性以及考虑计算成本的报告方式下评估持续学习的统一、任务多样基准尚不存在。我们提出 MedCL-Bench,它以流式方式呈现横跨五个任务族的十个生物医学 NLP 数据集,在八种任务顺序下评估十一种持续学习策略,并报告保持率、迁移率与 GPU 小时成本。在不同骨干模型与任务顺序下,对新任务的直接顺序微调会引发灾难性遗忘,导致更新后在先前任务上出现性能回退。各持续学习方法处于不同的保持-计算前沿:参数隔离在每 GPU 小时上提供最佳保持率,重放在更高成本下提供强保护,而正则化的收益有限。遗忘具有任务依赖性,多标签主题分类最易受损,而受约束输出类任务更为稳健。MedCL-Bench 为部署前审计模型更新提供了可复现的框架。

MedCL-Bench:生物医学持续学习中稳定性-效率权衡与扩展的基准测试:论文配图
图 1:MedCL-Bench 概述。 (a) 生物医学知识和数据集不断发展(例如,新文献和药物与疾病的关系),创建现实的连续更新流——无论是跨机构(数据无法汇集)还是机构内部。 (b) 顺序连续微调可能会覆盖先前获得的能力(灾难性遗忘),而 CL 的目标是在学习新任务的同时保留先验知识。 (c) MedCL-Bench 包含 10 个生物医学 NLP 数据集,分为五个任务系列(QA、事实检查、关系提取、文档分类和多标签主题分类)。 (d) 基准工作流程:预训练的主干在多个任务订单下的任务流上按顺序更新,并在每个阶段之后对所有先前看到的任务进行评估。 (e) 本工作中报告的 CL 指标:总体任务性能 (AP)、后向传输 (BWT) 和前向传输 (FWT)。 (f) 解决的关键问题:遗忘严重性、方法比较、顺序敏感性、计算效率和缩放/主干依赖性。图标来源于 Flaticon.com(补充说明中的完整归属)。