论文
DeepMed:通过多跳医疗搜索数据与轮次可控的Agentic训练及推理构建医疗DeepResearch智能体
DEEPMED: Building a Medical DeepResearch Agent via Multi-hop Med-Search Data and Turn-Controlled Agentic Training & Inference
摘要
医疗推理模型仍受参数化知识束缚,因而易发生遗忘和幻觉。DeepResearch(DR)模型将输出建立在来自工具的可验证证据上,在通用领域表现强劲,但其向医疗领域的直接迁移收益相对有限。我们将此归因于两个差距:任务特性和工具使用扩展。医疗问题需要在知识密集的临床语境中解释证据;通用DR模型虽能检索信息,但往往缺乏临床语境推理,因而“找到了却不会用”,性能受限于医疗能力。此外,在医疗场景中,盲目扩展工具调用会注入噪声上下文,使敏感的医疗推理偏离正轨,并促使模型沿错误路径反复寻找证据。因此,我们提出DeepMed。在数据方面,我们部署多跳医疗搜索问答合成方法,支持模型在医疗语境中应用DR范式。在训练方面,我们引入难度感知的轮次惩罚,抑制过度的工具调用增长。在推理方面,我们引入监视器,在受控步数内帮助验证假设并避免上下文腐化。总体而言,在七个医疗基准上,DeepMed平均将基座模型提升9.79%,并超越更大的医疗推理和DR模型。
