论文

MedCUA-Bench:面向临床计算机使用智能体的纯截图基准

MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents

智能体系统Agent任务评测

摘要

计算机使用的代理可以自动化重复的基于屏幕的临床工作,但它们在医学图形用户界面中的可靠性在很大程度上仍未得到验证。现有的基准测试侧重于一般的 Web 或桌面任务,而医疗软件的代表性不足,这些软件需要领域知识,与主流应用程序的 UI 设计明显不同,缺乏公共测试环境,并且需要完成任务之外的安全验证。我们推出 MedCUA-Bench,这是临床计算机使用代理的交互式基准。它涵盖了 10 个医疗领域的 18 个临床场景,根据真实的产品手册和开源医疗系统重建,以捕获真实的临床界面,同时避免许可和隐私限制。每个任务都附带配对的意图和步骤级目标,以将临床推理与 UI 执行分开,并由确定性检查器对任务完成情况和五个临床安全维度进行评估。在 23 个代理中,最好的闭源模型达到了 54.2% 的严格成功率,而所有模型在真实的 OpenEMR 上仍然低于 9%。开源代理平均只有2.5%,最好的达到16.2%。 MedCUA-Bench 揭示了当前药物与可靠的临床软件使用之间的差距,为未来的研究提供了可重复的测试平台。

MedCUA-Bench:面向临床计算机使用智能体的纯截图基准:论文配图
图 1:为什么医疗 GUI 代理需要专用基准。通用 GUI 基准缺乏现实的临床环境,无法捕获关键的医疗故障模式,其中名义任务完成可能仍然对应于不安全行为,并且计划错误通常与执行错误混为一谈。