论文

通过多代理协作实现可靠的胎儿超声解释

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

智能体系统Agent 架构与控制循环

摘要

自动胎儿超声解读需要一个从视觉感知(包括平面识别和解剖分割)到临床理解(包括生物测量和诊断报告)的工作流程。然而,普遍存在的“单一任务、单一模型”范式限制了这一多步骤过程中证据的系统整合。尽管多模态 大语言模型 (MLLM) 显示出有希望的视觉理解能力,但其有限的特定领域基础和幻觉风险限制了胎儿超声分析的可靠性。为了解决这些限制,我们提出了 FetUSAgents,这是一种工具增强的多智能体系统,用于全面的胎儿超声解释,支持视觉问答 (VQA)、报告生成、图像字幕和视频摘要。 FetUSAgents 通过协作 LLM 代理协调特定于任务的视觉工具,并将临床查询分解为从解剖识别到定量测量的子任务。我们进一步介绍了双路径证据仲裁(DPEA),它将基于 LLM 的审议推理与来自专门视觉工具的结构化计算证据集成在一起。检索增强的证据库整合了中间发现,以支持可追溯且有临床依据的结论。此外,我们构建了 FetUS-VQA,这是胎儿超声的专用 VQA 基准,包含 10 个临床任务的 1,892 张图像和 3,205 个问答对。广泛的分布外实验表明,FetUSAgents 的性能优于一般和医学 MLLM,在 VQA 准确性方面超出最强基线 25% 以上。这些结果表明了一条可扩展的途径,以证据驱动的产前成像临床助理。代码可用。