论文

从给出到收集的证据:Agentic 纵向医学推理学习

From Given to Gathered Evidence: Agentic Learning for Longitudinal Medical Reasoning

模型训练强化学习

摘要

基础模型可以通过工具使用Harness充当临床Agent。然而,传统的医学基准评估的是对预选证据的推理,而不是通过临床记录和纵向成像寻找证据的能力。我们提出 CASE:一系列用于寻求证据的特定角色的临床Agent,以及用于紧凑视觉语言政策模型的工具使用工具和 Agentic 后训练框架。我们进一步介绍了一个基于英国生物银行的纵向多模态基准,其中包括来自 4,739 名参与者的真实世界 ICD-10 编码诊断的 50,401 个临床问题。每个问题都与患者特定的环境相关,其中包含临床背景以及来自基线和随访的多序列 MRI,Agent自主选择进行检查和比较的就诊、器官、模式、切片和专业工具。有监督的微调从 14,734 个前沿模型交互轨迹中转移寻证工作流程,然后对学习者自己的环境交互进行 Agentic 强化学习。特权政策自我蒸馏和基于标题的大语言模型反馈完善了从证据到结论的推理,而无需规定工具序列。实验表明,CASE 超越了问答模仿,转向可转移的调查政策,加强了基于证据的纵向推理。在匹配的评估条件下,我们基于 Qwen3-VL-8B 的Agent在答案准确性方面比 GPT-5.4 和 Claude Opus 4.8 分别提高了 16% 和 10% 以上。代码可在 https://github.com/VinyehShaw/CASE. 获取