论文
MedCTA:临床工具代理的基准
MedCTA: A Benchmark for Clinical Tool Agents
摘要
为了做出基于临床的决策,医疗人工智能代理预计将超越简单的识别,并能够进行工具检索、证据获取和集成。现有的基准主要评估孤立的感知或单轮问答,因此对规划、工具招募和采样轨迹可靠性的失败提供的可见性有限。我们推出了 MedCTA,这是一个评估医疗工具代理的基准,用于根据临床医生验证的、基于实际多模式临床输入(包括放射学图像、病理切片和报告)的步骤隐式任务来评估医疗工具代理。 MedCTA 包含 107 项现实世界的临床任务,以及超过 5 个已部署工具的经过临床医生验证的可执行轨迹,并支持对工具选择、论证有效性、执行稳定性、轨迹保真度和结果质量的过程感知评估。我们对 18 个开源和闭源多模式模型进行了基准测试,发现即使是前沿系统在多步骤临床工具使用中仍然很脆弱:自主采样轨迹主要是协议失败、过早停止和不正确的工具招募,而标准参考工具路由产生了巨大但仍然不完整的收益。这些结果表明,在临床环境中,强烈的骨干感知并不能转化为可靠的代理行为。 MedCTA 为审核、诊断和推进值得信赖的医疗 AI 代理提供了严格的测试平台。数据集和评估套件可在 https://ivul-kaust.github.io/MedCTA/ 获取