论文
Meissa:多模态医疗智能体智能
Meissa: Multi-modal Medical Agentic Intelligence
摘要
多模态大语言模型(MM-LLM)在医学图像理解与临床推理方面表现出强大性能。近期的医疗智能体系统通过工具使用与多智能体协作对其进行扩展,实现复杂决策。然而,这些系统几乎完全依赖前沿模型(如GPT),其基于API的部署带来高成本、高延迟与隐私风险,与本地化临床部署要求相冲突。我们提出Meissa,一个轻量的40亿参数医疗MM-LLM,将智能体能力带到离线环境。Meissa不是模仿静态答案,而是通过从前沿模型蒸馏结构化轨迹,学习何时发起外部交互(策略选择)以及如何执行多步交互(策略执行)。具体而言,我们提出:(1)统一轨迹建模:轨迹(推理与动作痕迹)在单一的状态-动作-观测形式体系中表示,使一个模型能够在异构医疗环境中泛化。(2)三层分级监督:模型自身错误触发从直接推理到工具增强与多智能体交互的渐进升级,显式学习难度感知的策略选择。(3)前瞻-回顾监督:将探索性前向轨迹与事后合理化的执行轨迹配对,实现有效交互策略的稳定学习。在40K条精选轨迹上训练后,Meissa在覆盖放射学、病理学与临床推理的13个医疗基准的16个评测设置中的10个里,达到或超过专有前沿智能体。与Gemini-3等典型前沿模型相比参数少25倍以上,Meissa可完全离线运行,端到端延迟较API部署降低22倍。数据、模型与环境已发布于 https://github.com/Schuture/Meissa。
