论文
通过与临床世界模型交互,将患者动力学智能体化于LLM之中
Agentifying Patient Dynamics within LLMs through Interacting with Clinical World Model
摘要
ICU中的脓毒症管理要求在快速演变的患者生理状态下进行序贯治疗决策。尽管大语言模型(LLM)编码了广泛的临床知识并能依据指南推理,但它们并未天然锚定于以动作为条件的患者动力学。我们提出SepsisAgent,一个用于脓毒症治疗推荐的世界模型增强LLM智能体。SepsisAgent利用学习到的临床世界模型(Clinical World Model)模拟患者在候选补液-升压药干预下的反应,并在敲定处方前遵循"提议-模拟-精炼"工作流。我们首先证明,仅接入世界模型会使LLM的决策表现不稳定,这促使我们开展面向智能体的专门训练。随后,我们通过三阶段课程训练SepsisAgent:患者动力学监督微调、"提议-模拟-精炼"行为克隆,以及基于世界模型的智能体强化学习。在MIMIC-IV脓毒症轨迹上,SepsisAgent在离策略价值上优于所有传统RL与基于LLM的基线,同时在指南依从性与不安全动作指标下取得最佳安全性表现。进一步分析表明,与临床世界模型的反复交互使智能体习得患者演化中的规律,即使移除模拟器访问权限,这些规律依然有用。
