论文
PatientAgentBench:评估面向患者的健康AI智能体的基准框架
PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents
摘要
健康AI正从回答问题演进为与患者对话、对健康记录进行推理并代表患者行事的智能体系统。初级诊疗防范诊断错误与不安全医疗;协助该领域的智能体也应针对相同风险接受评估。当前基准聚焦医学知识,通过孤立的问答或面向临床医生的任务进行评估。PatientAgentBench对面向患者的智能体化医疗进行基准测试;它评估一个基础模型,该模型被包裹在配备医疗工具沙盒的智能体中,与模拟患者对话。每场对话由LLM-as-a-Jury依据一百多项与具体对话无关、以临床医生为依据的标准,在六个维度上评分。为验证对齐,持照临床医生对共享对话进行了标注,裁判与专家评分者之间达到79-93%的相邻一致率,与临床医生间评分者一致性相当或更高。我们在相同的1,200个场景上对四个家族的10个模型进行基准测试,发现了临床差距。分诊质量是最具区分度的维度:通过率从最弱模型的32%升至最强模型的88%,且智能体常在未做临床筛查的情况下处理行政请求。临床安全与工作流准确性呈相同模式:最弱模型频繁失败,捏造未执行的动作;前沿模型仅在1-3%的案例上失败,原因包括未验证的工具输出,以及紧急情况中遗漏危机资源。更强的模型缩小了这些差距但并未消除;最强模型总体仅得4.25分(满分5分)。这些失败只有在基于真实患者记录的持续、使用工具的对话中才会显现,这证实随着医疗智能体系统获得自主性,静态基准已不足以评估。我们发布该框架,作为可复现、经临床医生验证的评估标准,帮助该领域缩小这一差距。
