论文
Doctorina MedBench:基于代理的医疗人工智能的基于对话的基准和评估框架
Doctorina MedBench: A Dialogue-Based Benchmark and Evaluation Framework for Agent-Based Medical AI
摘要
我们提出了 Doctorina MedBench,这是一个基于代理的医疗人工智能的评估框架,基于医患互动的模拟。与依赖于解决标准化测试问题的传统医学基准不同,所提出的方法模拟了多步骤临床对话,其中人工智能系统必须收集病史,分析存在的可用合成附件,制定鉴别诊断,并提供诊断和管理建议。系统性能在不同的任务级领域进行评估,包括诊断、鉴别诊断、治疗、安全关键条件处理和对话步骤行为;更广泛的 D.O.T.S.框架用作诊断、观察/调查、治疗和步数统计的补充摘要。该框架还支持测试和质量监控工作流程,旨在识别开发过程中模型行为的变化。它支持以安全为导向的案例、基于类别的合成临床场景采样以及跨系统版本的回归式比较。在报告的研究中,分析的配对完整病例队列由 261 个尝试病例标识符中保留的 254 个医生撰写的合成临床病例组成。评估指标旨在用于交互式医疗人工智能系统的比较研究以及研究合成对话设置中的临床推理工作流程。我们的结果表明,模拟临床对话可以为传统考试式基准提供补充评估设置,而报告的结果并未建立独立的临床有效性、临床有效性或现实世界部署的准备情况。