论文
ART:面向医疗AI代理的动作型推理任务基准
ART: Action-based Reasoning Task Benchmarking for Medical AI Agents
摘要
可靠的临床决策支持需要医疗AI代理能够对结构化电子健康记录(EHR)进行安全的多步推理。虽然大语言模型(LLM)在医疗领域展现潜力,现有基准不足以评估涉及阈值判断、时间聚合与条件逻辑的动作型任务上的表现。我们提出ART,一个面向医疗AI代理的动作型推理临床任务基准,它挖掘真实EHR数据,针对已知推理弱点创建有挑战性的任务。通过分析现有基准,我们识别出三大主导错误类别:检索失败、聚合错误与条件逻辑误判。我们的四阶段流水线——场景识别、任务生成、质量审计与评估——产出多样、经临床验证、扎根于真实患者数据的任务。在600个任务上评估GPT-4o-mini与Claude 3.5 Sonnet显示:提示优化后检索近乎完美,但聚合(28-64%)与阈值推理(32-38%)仍存在巨大差距。通过暴露动作导向EHR推理的失败模式,ART推动更可靠临床代理的发展——这是AI系统减轻认知负荷与行政负担、在高需求诊疗环境中支持人力配置的关键一步。
