论文
CarePilot:医疗保健中长期计算机任务自动化的多代理框架
CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare
摘要
多模式代理管道通过实现复杂、现实世界任务的高效且可访问的自动化,正在改变人机交互。然而,最近的努力主要集中在短期或通用应用程序(例如移动或桌面界面)上,而对于特定领域的系统(特别是在医疗保健领域)的长期自动化在很大程度上尚未进行探索。为了解决这个问题,我们推出了 CareFlow,这是一种高质量的人工注释基准,包括跨医学注释工具、DICOM 查看器、EHR 系统和实验室信息系统的复杂、长期的软件工作流程。在此基准测试中,现有的视觉语言模型 (VLM) 表现不佳,在医疗环境中难以进行长视野推理和多步骤交互。为了克服这个问题,我们提出了 CarePilot,一个基于行动者批评范式的多智能体框架。 Actor将工具基础与双记忆机制(长期和短期经验)相结合,从视觉界面和系统状态预测下一个语义动作。评价智能体评估每个操作,根据观察到的效果更新记忆,并执行或提供纠正反馈以完善工作流程。通过迭代代理模拟,Actor 学会在推理过程中执行更稳健和推理感知的预测。我们的实验表明,CarePilot 实现了最先进的性能,在我们的基准数据集和分布外数据集上分别比强大的闭源和开源多模式基线高出约 15.26% 和 3.38%。