论文

UniReason-Med:用于医疗 VQA 中 2D 到 3D 传输的共享的视觉证据推理接口

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA

模型训练监督微调与指令调优

摘要

我们研究当两种输入类型通过通用推理接口对齐时,来自丰富 2D 医学图像的以视觉证据为依据的推理监督是否可以改善 3D 医学 VQA。我们引入了 UniReason-Med,这是一个单检查点框架,可在推理时处理 2D 图像或切片序列化 3D 体积,通过共享框语法、区域词元注入和通用视觉证据定位推理策略生成交错文本推理和本地化视觉证据。为了训练这个接口,我们构建了 UniMed-CoT,这是一个 220K 指令调整数据集,具有交错的文本推理和视觉证据定位视觉证据,包括 170K 2D 和 50K 3D 样本。通过监督 微调 和结果级强化学习,UniReason-Med 学会在 RL 期间生成视觉证据定位推理轨迹,而无需基于 IoU/Dice 的本地化奖励。数据混合和组件消融表明,联合 2D+3D 视觉证据定位监督比纯 3D 训练显着改善了 3D 推理,而视觉证据定位和区域词元注入始终有利于 2D 和 3D 任务。这些结果表明,共享的视觉证据定位推理接口可以将推理结构从 2D 图像转移到切片序列化的体积医学理解。代码和数据可在 https://github.com/IQuestLab/unireason-med 上公开获取。