论文

InfiMed2:来自背景证据和稳定性意识监督的综合医学多模式基础模型

InfiMed2: A Generalist Medical Multimodal Foundation Model from Contextual Evidence and Stability-Aware Supervision

模型训练持续学习

摘要

最近的医学多模态模型受益于更大的语料库、更广泛的模态覆盖范围和更强的推理导向训练,但持续预训练(CPT)和训练后的有效数据设计仍然具有挑战性。医疗资源在结构、粒度和信息密度方面存在很大差异,并且随着训练从广泛的知识获取到后期巩固的进展,它们的效用也发生变化。与此同时,后训练通常以简短的视觉问答为主,对信息丰富且答案一致的解释提供有限的监督。我们介绍 InfiMed2,这是一个围绕阶段感知数据设计构建的 4B 和 27B 通用医疗多模式基础模型系列。我们策划了一个 55.68B 词元语料库,通过特定来源的处理将广泛的临床知识与上下文丰富的生物医学视觉证据相结合。我们的 CPT 管道首先适应视觉编码器,然后构建广泛的医学知识,最后在学习率衰减期间过渡到以证据为中心的数据混合。对于监督微调(SFT),我们使用答案稳定性、答案屏蔽重建和正确性约束选择来重新生成视觉问答响应,以产生更多信息和答案一致的监督。 4B 模型通过具有可验​​证奖励的强化学习(RLVR)进一步优化。在五个医疗多模式基准中,InfiMed2-4B 在 RLVR 后实现了 66.73% 的平均准确率,超过了较大的 Qwen3.5-9B,而 InfiMed2-27B 达到了 73.72%,是评估的开放权重模型中最高的。