论文

PatientAgentBench:评估面向患者的健康AI智能体的基准框架

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

智能体系统Agent任务评测

摘要

健康AI正从回答问题演进为与患者对话、对健康记录进行推理并代表患者行事的智能体系统。初级诊疗防范诊断错误与不安全医疗;协助该领域的智能体也应针对相同风险接受评估。当前基准聚焦医学知识,通过孤立的问答或面向临床医生的任务进行评估。PatientAgentBench对面向患者的智能体化医疗进行基准测试;它评估一个基础模型,该模型被包裹在配备医疗工具沙盒的智能体中,与模拟患者对话。每场对话由LLM-as-a-Jury依据一百多项与具体对话无关、以临床医生为依据的标准,在六个维度上评分。为验证对齐,持照临床医生对共享对话进行了标注,裁判与专家评分者之间达到79-93%的相邻一致率,与临床医生间评分者一致性相当或更高。我们在相同的1,200个场景上对四个家族的10个模型进行基准测试,发现了临床差距。分诊质量是最具区分度的维度:通过率从最弱模型的32%升至最强模型的88%,且智能体常在未做临床筛查的情况下处理行政请求。临床安全与工作流准确性呈相同模式:最弱模型频繁失败,捏造未执行的动作;前沿模型仅在1-3%的案例上失败,原因包括未验证的工具输出,以及紧急情况中遗漏危机资源。更强的模型缩小了这些差距但并未消除;最强模型总体仅得4.25分(满分5分)。这些失败只有在基于真实患者记录的持续、使用工具的对话中才会显现,这证实随着医疗智能体系统获得自主性,静态基准已不足以评估。我们发布该框架,作为可复现、经临床医生验证的评估标准,帮助该领域缩小这一差距。

PatientAgentBench:评估面向患者的健康AI智能体的基准框架:论文配图
图 1:两种假设的药物接受相同的输入,但产生不同的临床结果。 (a) 共享基准设置(工具、助理提示和患者角色); (b) 代理 A 执行了正确的预约工作流程,但跳过了严重性评估,导致安全性和分类分数较低; (c) 代理 B 首先进行分类,识别药物相互作用风险,然后升级为紧急远程医疗。