MARCUS:用于心脏诊断与管理的智能体式多模态视觉语言模型
MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management
摘要
心血管疾病仍是全球首位死因,其进展受制于人对复杂心脏检查结果的人工解读。当前的AI视觉语言模型仅限于单一模态输入且不可交互。我们提出MARCUS(Multimodal Autonomous Reasoning and Chat for Ultrasound and Signals),一个智能体式视觉语言系统,可独立地或以多模态输入的方式对心电图(ECG)、超声心动图与心脏磁共振成像(CMR)进行端到端解读。MARCUS采用分层智能体架构,由各模态专属的视觉语言专家模型组成,每个专家模型将领域训练的视觉编码器与多阶段语言模型优化相结合,并由一个多模态编排器协调。MARCUS在1350万张图像(0.25M份ECG、1.3M张超声心动图图像、12M张CMR图像)以及我们新构建的专家整理的160万问题数据集上训练,取得了超越前沿模型(GPT-5 Thinking、Gemini 2.5 Pro Deep Think)的最先进性能。在内部(斯坦福)与外部(UCSF)测试队列中,MARCUS在ECG上达到87-91%的准确率,超声心动图为67-86%,CMR为85-88%,比前沿模型高出34-45%(P<0.001)。在多模态病例上,MARCUS取得70%的准确率,接近前沿模型(22-28%)的三倍,自由文本质量分数高出1.7-3.0倍。我们的智能体架构还赋予对海市蜃楼式推理(mirage reasoning)的抵抗力,即视觉语言模型从非预期的文本信号或幻觉出的视觉内容中推导结论的现象。MARCUS证明,领域专属视觉编码器配合智能体编排器能够实现多模态心脏解读。我们以开源方式发布模型、代码与基准。
