论文
EchoSonar-R:用于超声心动图疾病分类和报告生成的多视图推理模型
EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography
摘要
超声心动图是最广泛使用的非侵入性心脏成像方式,为心血管诊断提供重要信息。解释超声心动图需要综合多个心脏视图的补充证据,以识别异常并生成结构化的临床报告。虽然最近的努力侧重于提高分类性能,但大多数模型缺乏明确的诊断推理和具有空间定位的解剖证据,限制了临床医生的信任。我们推出了 EchoSonar-R,这是一种支持多视图推理的视觉语言模型,可联合执行多标签疾病分类和超声心动图研究的报告生成。 EchoSonar-R 将时空视频编码器与结构感知心脏探测器相结合,提供具有空间定位的解剖线索,以提高交叉视图推理过程中的可解释性和临床医生的信任。 EchoSonar-R 分两个阶段进行训练:对推理注释目标进行监督 微调 (SFT),然后进行具有特定任务奖励的组相对策略优化 (GRPO),在统一的强化学习框架内联合调整分类和报告生成。在私有多视图数据集和两个公共基准上,EchoSonar-R 在私有集上将宏观平衡准确度提高了 17.1%,在 MIMICEchoQA 上比最强基线提高了 6.1%,实现了 0.800 的 GREEN 临床 忠实性 分数,并生成基于多视图视觉证据的可解释推理轨迹。