论文

MDIA:HealthBench Professional上的多智能体诊断智能流水线

MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional

智能体系统Agent 架构与控制循环

摘要

在智能体LLM临床基准上报告的大多数提升常被归因于提示工程,而我们的结果表明,更大的改进可以来自架构与引擎层面的设计。我们提出MDIA,一个多智能体诊断智能体(Multi-agent Diagnostic Intelligence Agent),实现为七节点、按专科路由的临床推理图,在完整HealthBench Professional基准(n = 525)上以未微调的LLM运行。在OpenAI的GPT-5.4-2026-03-05下,MDIA取得0.6272,比OpenAI的ChatGPT for Clinicians高出3.72个百分点。实验工作表明性能提升可归因于系统架构:专科路由、多轮上下文保持、药物状态安全门控、站点过滤搜索、长度感知综合以及引擎级可靠性。这些发现支持如下观点:智能体临床基准表现既由底层基础模型塑造,也由编排架构塑造。尽管如此,我们也注意到使用其他模型作为评分器时的显著差异;特别是使用Gemini 2.5 Pro时,MDIA得分为0.6585,这表明评分器的选择是变异性的一个来源。因此,对LLM的稳健评估需要在多个独立评分模型上进行评估。

MDIA:HealthBench Professional上的多智能体诊断智能流水线:论文配图
图1:GPT-5.4评分下MDIA各版本与OpenAI系统对比,最新版超越ChatGPT for Clinicians 3.72个百分点。