论文

XMedFusion:用于自主医疗系统的知识引导多模态感知和推理框架

XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems

智能体系统Agent 协作

摘要

自主医疗和机器人系统越来越依赖智能感知和推理能力来解释视觉数据并支持临床决策。放射学报告生成是此类自动化诊断工作流程的关键组成部分,但现有的端到端多模态模型常常存在视觉证据依据薄弱的问题,导致解释不可靠并遗漏微妙的临床发现。本文介绍了 XMedFusion,这是一种模块化人工智能框架,旨在作为自主医疗系统的智能感知和推理模块。所提出的框架将视觉信息分解为模拟专家驱动分析的协调功能组件,包括提取基于图像的证据的视觉感知代理、构建临床相关发现的知识图构建代理以及确保报告结构一致的检索引导的起草过程。合成代理通过推理驱动的验证迭代地集成视觉和结构化证据,以产生可靠且可解释的诊断输出。对公共胸片数据集的实验评估表明,与基线视觉语言模型相比有了显着改进,BLEU-1 中的增益从 0.0493 提高到 0.3359,ROUGE-L 中的增益从 0.0863 提高到 0.2440,METEOR 中的增益从 0.0829 提高到 0.1708,并且语义评估指标(例如一致性(2.38 到 7.80)和准确性)也有显着改进。 (2.34 至 6.93)。结果强调了结构化多智能体感知和推理对于增强智能医学成像系统的稳健性、透明度和自动化的有效性,从而能够集成到自主医疗保健和机器人诊断工作流程中。