论文

密集临床对比增强大语言模型的医学知识更新

Dense Clinical Contrasts Enhance Medical Knowledge Updating in Large Language Models

模型训练监督微调与指令调优

摘要

医学知识不断变化,使得大语言模型容易依赖过时但临床上合理的信息。我们研究在匹配的训练预算设置下监督形式是否影响医学知识更新。我们引入了 SEER-Bench,这是一个根据最新版本的 SEER 研究数据发布的时间锚定肿瘤分期基准,并将 NCCN 肿瘤学指南中的相同医疗更新事件呈现为四种监督格式:EMQ、MSQ、FITB 和 SAQ。在 SEER-Bench 和 HealthBench Professional 中,EMQ 在相同预算的 SFT 变体中提供了最稳定的外部传输和保留。在 EMQ 监督下,更新的 4B 模型在时间锚定的肿瘤分期上产生了具有竞争力的结果,在 SEER-Bench 上达到了 64.8% 的答案准确性和 59.6% 的基本原理准确性。诊断分析表明,EMQ 暴露了更密集的临床对比信号,同时保留了与基本模型相比较小移动的判别性表示。这些结果表明,医学知识更新不仅取决于更新算法,还取决于知识如何构建为监督。

密集临床对比增强大语言模型的医学知识更新:论文配图
图1 重新设计的SFT监督格式概览。SAQ、FITB和MSQ依靠孤立的、一对一或一对一的决策结构。EMQ引入了联网结构,要求模型在一个共享的回答库内解决许多对多个通信。