论文

CLR-voyance:通过结果感知的量规强化住院患者临床决策支持的开放式推理

CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics

模型训练奖励建模与过程监督

摘要

住院患者临床推理是部分可观察性下的顺序决策:临床医生看到到目前为止的入院情况,必须选择下一步行动,其下游后果尚不可见。现有的临床 LLM 评估和 RL 奖励信号将其分解为封闭式检索、临床旅程泄漏或未锚定的 LLM 作为法官评分。我们引入了 CLR-voyance,这是一个框架,它将住院推理重新表述为部分可观察马尔可夫决策过程 (POMDP),并通过同时基于结果和临床医生验证的奖励来监督它。我们将这个公式实例化为 CLR-POMDP,它将成功的患者旅程分为政策可见的过去和只能预言的未来。使用过去的信息,预言机 LLM 生成特定于案例的查询-答案对,以及第一个用于临床推理的自适应标准,可在未来的患者旅程中进行验证。这些细则用于 后训练 和住院患者临床推理模型的评估。我们使用 GRPO 对 Qwen3-8B 和 MedGemma-4B 进行后训练,然后进行模型合并,产生最先进的住院临床推理,同时保留通才能力。 CLR-voyance-8B 在 CLR-POMDP 上达到了 84.91%,领先于 GPT-5 (77.83%) 和 MedGemma-27B (66.66%) 等前沿医学推理模型,并且在现有医学基准上具有相当或更好的性能。为了确保临床上有意义的设置,我们进行了一项大规模的临床医生一致性研究,其中医生策划每个病例的评分标准,对候选人的反应进行评分,并提供模型推理的盲法成对偏好。这项研究提供了关于临床 LLM 作为法官和临床偏好模型选择的见解,可以为整个社区提供信息。 CLR-voyance 已在合作公立医院部署了 6 个多月,起草了数千份包含大量推理的住院病历。