论文

HealthAgentBench:面向挑战前沿AI智能体的现实智能体医疗环境统一基准套件

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

智能体系统Agent任务评测长程任务评测

摘要

随着人工智能代理的复杂、长期推理能力越来越强,严格和全面的评估对于衡量现实世界医疗保健应用的进展至关重要。我们推出了 HealthAgentBench,这是一套涵盖 7 个类别的 54 项代理医疗保健任务,每个类别都有其独特的环境。该基准套件涵盖整个患者旅程中的不同工作流程和广泛的模式。每项任务都旨在复制端到端的临床工作流程:在给出最少的指令的情况下,代理必须探索原始医疗数据,在复杂的环境中操作,并执行超越简单提示的多步骤解决方案。报告最终任务成功率,为每个代理的 HealthAgentBench 整体性能提供单一、可解释的指标。在 HealthAgentBench 上评估前沿代理,我们发现总体任务成功率仍然很低,凸显了该套件的难度。最强大且最具成本效益的药剂 Codex GPT-5.5 仅实现约 42% 的成功率。除了总体表现之外,HealthAgentBench 还揭示了各个任务类别的细微优势和劣势。前沿代理在基于 EHR 数据自动开发研究建模管道方面表现出了希望,但医学成像仍然特别具有挑战性,特别是对于 Claude Code 模型,而 Codex GPT-5.5 显示了新兴功能。对于当前的所有智能体来说,将大型搜索空间与组合推理要求相结合的任务仍然很困难。总之,这些结果表明 HealthAgentBench 提供了一个具有挑战性且现实的基准,并为未来的进步提供了巨大的空间。我们在 https://github.com/microsoft/HealthAgentBench 发布了基准测试。

HealthAgentBench:面向挑战前沿AI智能体的现实智能体医疗环境统一基准套件:论文配图
图 1:HealthAgentBench 是代理医疗保健 AI 的统一评估框架。每个基准测试任务都打包为具有三个阶段的 Docker 容器环境:(1) 容器通过在 /data/ 下暂存患者数据和必要的人工制品来设置环境(此处,X 射线报告校正任务包含一名患者的纵向胸部 X 射线历史记录,其中目标研究的报告包含代理必须更正的损坏的 FINDINGS 草稿); (2) 向代理发出自然语言指令; (3) 代理在终端中运行,发出工具调用(它可以自由决定是否安装软件包或运行命令来查看、裁剪和放大图像或查阅患者之前的研究),直到将更正的报告写入 /workspace/submission.json。评估在容器外部根据隐藏的专家审查的事实和二元成功标准进行。相同的容器化框架实例化了所有 7 个任务类别(右),每个任务类别都在一个独特的环境中,并显示每个类别的输入模式和任务数量。