论文
MedUPS:利用 大语言模型 为罕见医疗病例提供诊断协助
MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models
摘要
不常见和偏离指南的病例很难支持临床决策,因为医生必须在诊断不确定的情况下做出一系列管理决策,并且很少能立即看到完整的病例。大多数 大语言模型 (LLM) 医学基准仅对最终诊断进行评分,但许多临床护理取决于下一个适当的行动:要进行的下一个测试、要获得的影像学研究、要涉及的专家或要追求的差异。我们引入了 MedUPSQA,这是一个由 5,535 个真实病例报告构建的 21,874 个中流临床决策点的数据集,以及 MedUPS,这是一个对齐框架,用于监督这些中间决策沿患者轨迹展开的模型。我们使用外部 LLM-as-a-Judge 奖励,将自由文本案例演示分割成按时间顺序排列的累积临床块,并调整模型以通过强化学习 (GRPO) 来预测下一步。这一目标反映了临床医生实际与患者会面的方式,通过积累证据进行下一步决策的推理,而不是承诺最终的标签。在三个骨干网中,中流对齐将 Qwen3.6-27B 的下一步准确率从 55.2 提高到 66.7,Qwen3.5-9B 从 47.2 提高到 57.8,HuatuoGPT-3-8B 从 37.8 提高到 44.4,置信区间为 95%。在几个模型规模中,我们测试的目标比规模更能提高准确性,较小的模型超越了我们评估的较大的前沿模型。我们进一步在中流任务上训练有监督的 微调 (SFT) 基线,SFT 改进了基础之上的所有主干,表明目标框架独立于优化器携带信号。我们发布数据集、代码和对齐的检查点。