论文

MedOpenClaw 和 MedFlowBench:在全面研究工作流程中审核医疗代理

MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows

智能体系统Agent任务评测

摘要

医学成像基准通常在预先选择的 2D 图像、切片、裁剪或斑块上评估 VLM,使评估更接近视觉识别。真实的临床工作流程会带来不同的负担:读者必须搜索完整的研究,操作成像软件,浏览切片和放大倍数,并记录可以审核的视觉证据。我们认为,这种证据生成工作流程是医学成像剂缺失的一个关键评估轴。为了研究它,我们引入了 MedFlowBench(VLM 代理的全面研究基准)以及 MedOpenClaw(一个受控且可重播的运行时,代理在其中操作 3D Slicer 和 QuPath 等医学成像查看器)。在每一集中,代理检查完整的放射学研究或整个幻灯片病理图像,返回任务答案,并提交结构化证据,包括关键切片、坐标、感兴趣区域或病变状态字段。该证据会根据保留的掩码、注释和标签自动进行检查。在评估的模型中,最终的仅答案评分给出了过于乐观的画面:当答案也必须得到正确证据的支持时,复杂工作流程的性能会大幅下降。我们进一步发现,添加图像分析工具本身并不能解决问题。当工具使复杂的过程变得简单可靠时,工具会有所帮助,但当代理必须选择输入、管理查看器状态并验证多个步骤的中间输出时,他们仍然会遇到困难。 MedFlowBench 揭示了医学成像剂是否可以从完整的研究中产生可审计的证据,而不是从选定的图像中产生合理的答案。