论文
MedCUA-Bench:面向临床计算机使用智能体的纯截图基准
MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents
摘要
计算机使用的代理可以自动化重复的基于屏幕的临床工作,但它们在医学图形用户界面中的可靠性在很大程度上仍未得到验证。现有的基准测试侧重于一般的 Web 或桌面任务,而医疗软件的代表性不足,这些软件需要领域知识,与主流应用程序的 UI 设计明显不同,缺乏公共测试环境,并且需要完成任务之外的安全验证。我们推出 MedCUA-Bench,这是临床计算机使用代理的交互式基准。它涵盖了 10 个医疗领域的 18 个临床场景,根据真实的产品手册和开源医疗系统重建,以捕获真实的临床界面,同时避免许可和隐私限制。每个任务都附带配对的意图和步骤级目标,以将临床推理与 UI 执行分开,并由确定性检查器对任务完成情况和五个临床安全维度进行评估。在 23 个代理中,最好的闭源模型达到了 54.2% 的严格成功率,而所有模型在真实的 OpenEMR 上仍然低于 9%。开源代理平均只有2.5%,最好的达到16.2%。 MedCUA-Bench 揭示了当前药物与可靠的临床软件使用之间的差距,为未来的研究提供了可重复的测试平台。
