论文
HealthBench Professional:在真实临床医生聊天中评估 大语言模型
HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats
摘要
数以百万计的临床医生使用 ChatGPT 来支持临床护理,但对模型临床医生对话中最常见用例的评估是有限的。我们推出了 HealthBench Professional,这是一个开放基准,用于评估临床医生在工作过程中带到 ChatGPT 的实际任务中的 大语言模型。该基准围绕临床实践的三个常见用例组织:护理咨询、写作和文档以及医学研究。每个示例都包含医生与 ChatGPT for Clinicians 进行的对话,并通过三个或更多医生在三个阶段编写和反复裁决的评分标准进行评分。 HealthBench Professional 示例针对 OpenAI 当前前沿模型的质量、代表性和难度进行了精心挑选,以便能够持续衡量进展。相对于 15,079 个示例的候选池,最近 OpenAI 模型的困难示例丰富了大约 3.5 倍。此外,大约三分之一的例子涉及医生对模型进行有意的对抗性测试。作为强有力的基线,我们还收集了人类医生对所有任务的反应(无限时间、专家匹配、网络访问)。 ChatGPT for Clinicians 中的最佳评分系统 GPT-5.4 优于基础 GPT-5.4、所有其他模型和人类医生。我们希望 HealthBench Professional 为医疗保健人工智能社区提供一种追踪现实临床任务中前沿模型进展的方法,并构建临床医生可以信赖的系统来改善护理。