论文
HealthAdminBench:在医疗行政管理任务上评测计算机使用智能体
HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks
摘要
医疗行政管理每年支出超过1万亿美元,是LLM驱动的计算机使用智能体(CUA)大有可为的目标。尽管LLM的临床应用受到大量关注,目前尚无在端到端行政工作流上评测CUA的基准。为填补这一空白,我们提出HealthAdminBench,该基准包含四个真实GUI环境——一个EHR、两个付款方门户和一个传真系统——以及135个专家定义的任务,涵盖三类行政任务类型:事先授权(Prior Authorization)、申诉与拒付管理(Appeals and Denials Management)、以及耐用医疗设备(DME)订单处理。每个任务被分解为细粒度、可验证的子任务,共产生1,698个评测点。我们在多种提示与观测设置下评测七种智能体配置,发现尽管子任务表现强劲,端到端可靠性仍然很低:表现最好的智能体(Claude Opus 4.6 CUA)任务成功率仅为36.3%,而GPT-5.4 CUA获得最高的子任务成功率(82.8%)。这些结果揭示了当前智能体能力与真实行政工作流需求之间的巨大差距。HealthAdminBench为评估医疗行政工作流迈向安全可靠自动化的进展提供了严谨的基础。
