论文

MARCUS:用于心脏诊断与管理的智能体式多模态视觉语言模型

MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management

智能体系统Agent 架构与控制循环

摘要

心血管疾病仍是全球首位死因,其进展受制于人对复杂心脏检查结果的人工解读。当前的AI视觉语言模型仅限于单一模态输入且不可交互。我们提出MARCUS(Multimodal Autonomous Reasoning and Chat for Ultrasound and Signals),一个智能体式视觉语言系统,可独立地或以多模态输入的方式对心电图(ECG)、超声心动图与心脏磁共振成像(CMR)进行端到端解读。MARCUS采用分层智能体架构,由各模态专属的视觉语言专家模型组成,每个专家模型将领域训练的视觉编码器与多阶段语言模型优化相结合,并由一个多模态编排器协调。MARCUS在1350万张图像(0.25M份ECG、1.3M张超声心动图图像、12M张CMR图像)以及我们新构建的专家整理的160万问题数据集上训练,取得了超越前沿模型(GPT-5 Thinking、Gemini 2.5 Pro Deep Think)的最先进性能。在内部(斯坦福)与外部(UCSF)测试队列中,MARCUS在ECG上达到87-91%的准确率,超声心动图为67-86%,CMR为85-88%,比前沿模型高出34-45%(P<0.001)。在多模态病例上,MARCUS取得70%的准确率,接近前沿模型(22-28%)的三倍,自由文本质量分数高出1.7-3.0倍。我们的智能体架构还赋予对海市蜃楼式推理(mirage reasoning)的抵抗力,即视觉语言模型从非预期的文本信号或幻觉出的视觉内容中推导结论的现象。MARCUS证明,领域专属视觉编码器配合智能体编排器能够实现多模态心脏解读。我们以开源方式发布模型、代码与基准。

MARCUS:用于心脏诊断与管理的智能体式多模态视觉语言模型:论文配图
图 1:MARCUS 的研究设计和评估框架。a. MARCUS 架构和训练流程概述。该模型集成了三种心脏诊断方式:心电图 (ECG)、超声心动图 (Echo) 和心脏磁共振 (CMR)。 ECG 数据(0.25M ECG)通过 SigLIP 视觉编码器和 2 层 MLP 投影处理为 3B 参数语言模型。 Echo(127 万张图像)和 CMR(1219 万张图像)数据利用具有时间聚合和跨视图融合模块的多视图视觉编码器,输入到通过组相对策略优化 (GRPO) 优化的语言模型中。多模态编排代理将这些输入合成为统一的文本输出。训练过程采用多阶段优化策略,包括对 741,000 个视觉问答对进行监督微调,以及对 879,000 个诊断性多项选择题进行 GRPO 强化学习。 b.评估和验证工作流程。该模型的性能使用内部测试集(斯坦福)和外部验证队列(UCSF)进行基准测试。评估包括两个不同的轨道:(1) 跨所有三种心脏模式的视觉多项选择问题,以评估精度;(2) 开放式临床推理文本问题,以评估模型专家级自由文本合成和交互的能力。