论文

DeepMed:通过多跳医疗搜索数据与轮次可控的Agentic训练及推理构建医疗DeepResearch智能体

DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference

模型训练强化学习

摘要

医疗推理模型仍受参数化知识束缚,因而易发生遗忘和幻觉。DeepResearch(DR)模型将输出建立在来自工具的可验证证据上,在通用领域表现强劲,但其向医疗领域的直接迁移收益相对有限。我们将此归因于两个差距:任务特性和工具使用扩展。医疗问题需要在知识密集的临床语境中解释证据;通用DR模型虽能检索信息,但往往缺乏临床语境推理,因而“找到了却不会用”,性能受限于医疗能力。此外,在医疗场景中,盲目扩展工具调用会注入噪声上下文,使敏感的医疗推理偏离正轨,并促使模型沿错误路径反复寻找证据。因此,我们提出DeepMed。在数据方面,我们部署多跳医疗搜索问答合成方法,支持模型在医疗语境中应用DR范式。在训练方面,我们引入难度感知的轮次惩罚,抑制过度的工具调用增长。在推理方面,我们引入监视器,在受控步数内帮助验证假设并避免上下文腐化。总体而言,在七个医疗基准上,DeepMed平均将基座模型提升9.79%,并超越更大的医疗推理和DR模型。

DeepMed:通过多跳医疗搜索数据与轮次可控的Agentic训练及推理构建医疗DeepResearch智能体
图2:用于 DeepMed 的 Agentic SFT 的多跳 Med-Search 数据合成工作流。上面板展示我们如何利用多来源网络证据合成强调逻辑关系的多跳医疗链。下面板展示这些链如何被转化为 Med-Search QA。