论文

L2D-Clinical:学习推迟临床文本分类中的自适应模型选择

L2D-Clinical: Learning to Defer for Adaptive Model Selection in Clinical Text Classification

应用与实践行业应用

摘要

临床文本分类需要在专门的微调模型(BERT 变体)和通用 大语言模型 (LLM) 之间进行选择,但两者都不在所有实例中占主导地位。我们引入了针对临床文本的 Learning to Defer (L2D-Clinical),该框架可根据不确定性信号和文本特征来学习 BERT 分类器何时应遵循 LLM。与之前的 L2D 工作不同的是,当 LLM 补充 BERT 时,我们的方法可以实现自适应延迟,从而提高准确性。我们评估两项英语临床任务:(1) ADE 检测 (ADE Corpus V2),其中 BioBERT (F1=0.911) 优于 LLM (F1=0.765),以及 (2) 治疗结果分类(MIMIC-IV 与多 LLM 共识 真值),其中 GPT-5-nano (F1=0.967) 优于 ClinicalBERT (F1=0.887)。在 ADE 上,L2D-Clinical 通过有选择地推迟 7% 的实例(其中 LLM 的高召回率补偿了 BERT 的失误),实现了 F1=0.928(比 BERT 多了 1.7 分)。在 MIMIC 上,L2D-Clinical 仅将 16.8% 的案例推迟到 LLM,从而实现了 F1=0.980(比 BERT 多了 9.3 分)。关键的见解是 L2D-Clinical 学会有选择地利用 LLM 的优势,同时最大限度地降低 API 成本。