论文

GAZE:利用观察者级工具和文献检索对稀有脑 MRI 进行扎根代理零样本评估

GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

智能体系统Agent任务评测

摘要

视觉语言模型 (VLM) 在一次前向传递中读取图像并生成文本,而放射科医生通常会多次检查图像并在撰写报告之前查阅文献。我们引入了 GAZE(基于证据的Agent零样本评估),这是一个框架,通过调用查看器级工具(缩放、窗口、对比度、边缘检测)和美国国家医学图书馆支持的两个检索工具(PubMed 用于医学文献,Open-i 用于放射图像),让医学 VLM 以这种迭代方式工作,并根据模式验证结构化输出,并记录完整的工具调用跟踪以供审核。在 NOVA(涵盖 281 种罕见神经系统疾病的 906 例脑部 MRI 病例基准)上,GAZE 的病灶定位在交集比联合 (IoU) 0.3 下达到了 58.2 平均精度 (mAP),在联合协议下达到了 34.9% 的 Top-1 诊断准确率,该协议仅根据图像对字幕、诊断和定位进行评分,无需特定任务 微调。在使用任何工具之前,结构化提示和模式验证的输出已经比已发布的 Gemini 2.0 Flash 基线(20.2 至 29.4 mAP@0.3)有所改进,因此框架设计本身就是一个实验变量。工具的使用对罕见疾病的帮助不成比例:对于具有三个或更少示例的诊断,IoU > 0.3 的病例比例从 17% 上升到 58%,而对于常见疾病($\geq$10 病例),这一比例从 25% 上升到 68%,并且跟踪参与度有所提高(Gemini 3 Flash:Cohen's d = 0.79,每个病例调用工具 11.8 次;Gemini 2.0 Flash:用于诊断的工具8.2% 的病例,无显着益处)。检索消融还揭示了一种依赖于模型的权衡,其中诊断的收益可能与定位的损失同时发生,从而强化了对医疗 VLM 中的诊断、定位和字幕进行联合评估的理由。