论文
AutoMedBench:迈向智能体AI模型的医学自动研究
AutoMedBench: Towards Medical AutoResearch with Agentic AI Models
摘要
人们越来越期望自主代理能够支持端到端的医疗人工智能研究工作流程,超越孤立的预测任务或简短的临床问答。然而,现有的医疗代理基准主要评估最终输出,对研究过程中代理行为的可见性有限。为了弥补这一差距,我们推出了 AutoMedBench,这是一个工作流程感知基准,用于跨不同医学成像和多模态推理任务的自主医疗 AI 研究,将代理执行组织为统一的五阶段工作流程 (S1-S5):计划、设置、验证、推理和提交。它由长期任务组成,每次运行平均 33 轮智能体,涵盖五个研究方向:分割、图像增强、视觉问答 (VQA)、报告生成和病变检测。每个任务都在两个难度级别(Lite 和 Standard)下进行评估,它们使用相同的数据和指标,但任务简报支架的数量不同,并且每次运行都使用最终任务性能和 S1-S5 阶段分数进行评分,从而实现从初始任务简报到最终提交的工件的阶段级分析。在数千次记录的运行中,阶段级评分显示,平均而言,验证是最弱的工作流程阶段,而设置是最强的,这表明当前代理更擅长使管道可执行,而不是验证其可靠性。运行后错误分析进一步表明,验证和提交失败在标记错误中占主导地位,分别占触发代码的 37.7% 和 38.1%,而任务理解错误很少见,为 0.9%,并且带有一个触发错误代码的运行的总体得分平均比没有错误代码的运行低 48%。
