论文
CARE:以证据依据对齐的 Agentic 框架迈向多模态医学推理的临床问责
CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
摘要
大型视觉语言模型(VLM)展现出强大的多模态医学推理能力,但多数以端到端黑箱方式运行,偏离临床医生基于证据的分阶段工作流,妨碍临床问责。与之互补,专业视觉定位模型能准确框定感兴趣区域(ROI),提供显式、可靠的证据,同时提升推理准确性与信任度。本文提出 CARE,以证据接地的 Agentic 框架推进多模态医学推理的临床问责。与在单一通用模型中耦合定位与推理的既有方法不同,CARE 把任务分解为协同的子模块以减少捷径学习和幻觉:紧凑 VLM 提出相关医学实体;专家级实体指涉分割模型产生像素级 ROI 证据;接地的 VLM 在 ROI 提示增广的完整图像上推理。这些 VLM 用可验证奖励的强化学习优化,使答案与支持证据对齐。此外,一个 VLM 协调器规划工具调用并审查证据-答案一致性,提供 Agentic 控制与最终验证。在标准医学 VQA 基准上评估,我们的 CARE-Flow(无协调器)较同等规模(10B)的最先进(SOTA)模型平均准确率提升 10.9%。借助动态规划与答案审查,CARE-Coord 带来进一步提升,超出重度预训练的 SOTA 5.2%。我们的实验表明,一个模拟临床工作流、纳入解耦专用模型与显式证据的 Agentic 框架,能产生更准确、更可问责的医学 AI。项目主页:https://xypb.github.io/CARE-Project-Page/。
