论文
密集临床对比增强大语言模型的医学知识更新
Dense Clinical Contrasts Enhance Medical Knowledge Updating in Large Language Models
摘要
医学知识不断变化,使得大语言模型容易依赖过时但临床上合理的信息。我们研究在匹配的训练预算设置下监督形式是否影响医学知识更新。我们引入了 SEER-Bench,这是一个根据最新版本的 SEER 研究数据发布的时间锚定肿瘤分期基准,并将 NCCN 肿瘤学指南中的相同医疗更新事件呈现为四种监督格式:EMQ、MSQ、FITB 和 SAQ。在 SEER-Bench 和 HealthBench Professional 中,EMQ 在相同预算的 SFT 变体中提供了最稳定的外部传输和保留。在 EMQ 监督下,更新的 4B 模型在时间锚定的肿瘤分期上产生了具有竞争力的结果,在 SEER-Bench 上达到了 64.8% 的答案准确性和 59.6% 的基本原理准确性。诊断分析表明,EMQ 暴露了更密集的临床对比信号,同时保留了与基本模型相比较小移动的判别性表示。这些结果表明,医学知识更新不仅取决于更新算法,还取决于知识如何构建为监督。
