论文

Echo-α:用于超声解释的大型代理多模态推理模型

Echo-α: Large Agentic Multimodal Reasoning Model for Ultrasound Interpretation

模型训练强化学习

摘要

超声解释需要精确的病灶定位和整体临床推理,但现有方法通常只擅长其中一种能力:专用探测器提供强大的定位但推理有限,而多模态 大语言模型 (MLLM) 提供灵活的推理但在专业医学领域的基础薄弱。我们提出了 Echo-α,一种用于超声解释的代理多模态推理模型,它将这些优势统一在调用和推理框架内。 Echo-α 经过训练,可以协调特定器官的检测器输出,将其与全局视觉上下文相集成,并将所得证据转换为超越仅检测器推理的基础诊断决策。这种行为是通过九任务监督课程建立的,然后通过在不同奖励权衡下的顺序强化学习来完善,产生用于病变锚定的 Echo-α-Grounding 和用于最终诊断的 Echo-α-Diagnosis。在多中心肾脏和乳腺超声基准上,Echo-α 在基础和诊断方面均优于竞争基准。特别是,在跨中心测试集上,Echo-α-Grounding 在肾脏/乳腺超声方面的总体准确率达到 56.73%/43.78% F1@0.5,Echo-α-Diagnosis 的总体准确率达到 74.90%/49.20%。这些结果表明,代理多模态推理可以将专门的探测器转化为可验证的临床证据,为实现更准确、可解释和可转移的超声人工智能系统提供了一条实用途径。存储库位于 https://github.com/MiliLab/Echo-Alpha。