论文

MedConsultBench:面向医疗问诊智能体的全周期、细粒度、过程感知基准

MedConsultBench: A Full-Cycle, Fine-Grained, Process-Aware Benchmark for Medical Consultation Agents

智能体系统Agent任务评测

摘要

当前对医疗问诊智能体的评估往往优先考虑面向结果的任务,常常忽视真实执业所必需的端到端过程完整性与临床安全。尽管近期的交互式基准引入了动态场景,它们通常仍然碎片化且粗粒度,无法捕捉专业问诊所要求的结构化问诊逻辑与诊断严谨性。为填补这一空白,我们提出 MedConsultBench,一个旨在评估完整在线问诊周期的综合框架,覆盖从病史采集、诊断到治疗方案制定与随访问答的整个临床工作流。我们的方法引入原子信息单元(AIU)以在子轮次层面追踪临床信息获取,通过 22 个细粒度指标实现对关键事实如何被问出的精确监测。通过处理在线问诊固有的欠规范与歧义,该基准评估兼具不确定性意识且简洁的问诊,同时强调用药方案兼容性,以及通过遵循约束的方案修订处理真实处方后随访问答的能力。对 19 个大语言模型的系统评估显示,高诊断准确率常常掩盖信息收集效率和用药安全方面的显著缺陷。这些结果凸显理论医学知识与临床实践能力之间的关键差距,并把 MedConsultBench 确立为使医疗 AI 与真实临床护理的细致要求对齐的严格基础。

MedConsultBench:面向医疗问诊智能体的全周期、细粒度、过程感知基准
图2:基准建设及评估流程概览