HealthAgentBench:面向挑战前沿AI智能体的现实智能体医疗环境统一基准套件
HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
摘要
随着人工智能代理的复杂、长期推理能力越来越强,严格和全面的评估对于衡量现实世界医疗保健应用的进展至关重要。我们推出了 HealthAgentBench,这是一套涵盖 7 个类别的 54 项代理医疗保健任务,每个类别都有其独特的环境。该基准套件涵盖整个患者旅程中的不同工作流程和广泛的模式。每项任务都旨在复制端到端的临床工作流程:在给出最少的指令的情况下,代理必须探索原始医疗数据,在复杂的环境中操作,并执行超越简单提示的多步骤解决方案。报告最终任务成功率,为每个代理的 HealthAgentBench 整体性能提供单一、可解释的指标。在 HealthAgentBench 上评估前沿代理,我们发现总体任务成功率仍然很低,凸显了该套件的难度。最强大且最具成本效益的药剂 Codex GPT-5.5 仅实现约 42% 的成功率。除了总体表现之外,HealthAgentBench 还揭示了各个任务类别的细微优势和劣势。前沿代理在基于 EHR 数据自动开发研究建模管道方面表现出了希望,但医学成像仍然特别具有挑战性,特别是对于 Claude Code 模型,而 Codex GPT-5.5 显示了新兴功能。对于当前的所有智能体来说,将大型搜索空间与组合推理要求相结合的任务仍然很困难。总之,这些结果表明 HealthAgentBench 提供了一个具有挑战性且现实的基准,并为未来的进步提供了巨大的空间。我们在 https://github.com/microsoft/HealthAgentBench 发布了基准测试。
