论文
MedMASLab:多模态医疗多智能体系统基准测试的统一编排框架
MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems
摘要
多智能体系统(MAS)虽在复杂临床决策支持上展现潜力,但该领域仍受架构碎片化与多模态集成标准化缺失拖累。当前医疗MAS研究存在数据接入管线不统一、视觉推理评估不一致与跨专科基准缺失的问题。为应对这些挑战,我们提出MedMASLab——面向多模态医疗多智能体系统的统一框架与基准平台。MedMASLab引入:(1)标准化多模态智能体通信协议,使11种异构MAS架构在24种医疗模态上无缝集成;(2)自动化临床推理评估器:零样本语义评估范式,利用大型视觉语言模型核验诊断逻辑与视觉定位,克服词面匹配的局限;(3)迄今最大规模基准:覆盖11个器官系统与473种疾病,统一了11个临床基准的数据。系统评估揭示关键的领域特异性差距:MAS虽提升推理深度,现有架构在跨医学子域切换时表现出显著脆弱性。我们对交互机制与成本-性能权衡做了严格消融,为未来自主临床系统确立新的技术基线。源码与数据公开于https://github.com/NUS-Project/MedMASLab/。
