论文

Fathom-Vaidya:用量规奖励推进医学推理

Fathom-Vaidya: Advancing Medical Reasoning with Rubric-Based Rewards

模型训练强化学习Agentic RL

摘要

在医疗保健中部署大语言模型(LLM)需要在两个互补维度上都有稳健表现:诊断推理——从临床数据推断患者病情以产生诊断的收敛式、证据驱动任务;以及临床医疗推理——在多轮临床交互中进行沟通、规划和适应的更广泛的导航式判断,此时可能不存在唯一正确答案。HealthBench 和 MedXpertQA 等近期基准揭示了这两个方面的持续弱点,暴露了复杂诊断场景中的失败以及情境化、以患者为中心对话的局限。我们提出一个顺序训练框架,利用合成数据和基于量规的强化学习针对这些侧面。首先,使用源自 MedBullets 的问题及规则与量规引导的强化学习(RL)改进诊断推理。随后转向临床推理:生成 5.3k 个合成多轮场景,每个场景配有多维量规以全面评估回复。该方法在 MedXpertQA 上带来超过 10% 的提升,我们的 30B 模型在 HealthBench-Hard 上达到 50.1% 的准确率,超越包括 GPT-5(thinking)在内的专有基线。结果表明,有针对性的合成数据集和基于量规的训练可以系统性提升医学 LLM 的诊断与交互式临床推理。

Fathom-Vaidya:用量规奖励推进医学推理:论文配图
图 1:Vaidya-Rubrics 中病例在各主题上的分布