论文

CARE:以证据依据对齐的 Agentic 框架迈向多模态医学推理的临床问责

CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework

智能体系统模型训练强化学习Agent 架构与控制循环RLVRAgentic RL

摘要

大型视觉语言模型(VLM)展现出强大的多模态医学推理能力,但多数以端到端黑箱方式运行,偏离临床医生基于证据的分阶段工作流,妨碍临床问责。与之互补,专业视觉定位模型能准确框定感兴趣区域(ROI),提供显式、可靠的证据,同时提升推理准确性与信任度。本文提出 CARE,以证据接地的 Agentic 框架推进多模态医学推理的临床问责。与在单一通用模型中耦合定位与推理的既有方法不同,CARE 把任务分解为协同的子模块以减少捷径学习和幻觉:紧凑 VLM 提出相关医学实体;专家级实体指涉分割模型产生像素级 ROI 证据;接地的 VLM 在 ROI 提示增广的完整图像上推理。这些 VLM 用可验证奖励的强化学习优化,使答案与支持证据对齐。此外,一个 VLM 协调器规划工具调用并审查证据-答案一致性,提供 Agentic 控制与最终验证。在标准医学 VQA 基准上评估,我们的 CARE-Flow(无协调器)较同等规模(10B)的最先进(SOTA)模型平均准确率提升 10.9%。借助动态规划与答案审查,CARE-Coord 带来进一步提升,超出重度预训练的 SOTA 5.2%。我们的实验表明,一个模拟临床工作流、纳入解耦专用模型与显式证据的 Agentic 框架,能产生更准确、更可问责的医学 AI。项目主页:https://xypb.github.io/CARE-Project-Page/。

CARE:以证据接地的 Agentic 框架迈向多模态医学推理的临床问责
图2:方法概览。所提出的CARE由一个VLM协调器与一组任务特定的专家模型组成。协调器规划工具使用并进行答案审查,按需调用各专家模型。专家集合包括:(1) 以问题为条件的实体提议VLM,用于识别相关的解剖结构/病灶;(2) 指代分割模型,利用像素级ROI证据对实体进行定位;以及 (3) 基于证据的VQA VLM,在经选定视觉证据(放大、掩码或全局指示器)增强的图像上进行推理。