论文

MedGuideX:将可执行指南中的决策逻辑内化到大语言模型以支持临床推理

MedGuideX: Internalizing Decision Logic from Executable Guidelines into Large Language Models for Clinical Reasoning

模型训练合成数据

摘要

临床实践指南(CPG)编码了循证的决策逻辑,临床医生通过评估患者变量、条件判据与推荐规则来应用这些逻辑。然而,现有方法常将CPG用作自由文本训练数据或检索来源,未能充分利用其程序性决策结构。为更好地利用这一结构,我们提出一个由指南导出的训练流水线,将CPG推荐转化为可执行的临床决策逻辑,并用其生成事实性与反事实问答数据。这些数据既教会模型指南支持的决策,也教会模型决策如何随患者条件的不同而改变。在生成的数据上对医学LLM做后训练即得到MedGuideX。在四个临床推理基准上,MedGuideX的平均准确率相对提升10.28%。医生评估进一步显示,MedGuideX能更好地还原临床医生撰写的推理步骤,并在忠实性、有效性、完整性与清晰度上产出医生更偏好的理由说明。总体而言,我们的结果表明,来自CPG的可执行决策逻辑可转化为可扩展的监督信号,用于构建可靠的医学LLM。

MedGuideX:将可执行指南中的决策逻辑内化到大语言模型以支持临床推理:论文配图
图 1:MedGuideX 概述。顶部:我们通过中间决策树将原始 CPG 转换为可执行的 Python 函数 ff,然后对临床变量 XX 进行采样并执行 f⁡(X)f(X) 来确定性地标记事实和反事实 QA 实例。底部:我们在混合 QA 上使用 SFT 和在事实 QA 上使用 RL 来对 LLM 进行后训练,其中重新执行 ff 会提供奖励。这种设计将每个指南变成一个可执行的验证器,将标签和奖励都建立在其决策逻辑中。