论文

MedBenchAgent:以约束编译自动构造医学VLM评测

MedBenchAgent: Towards Systematic Automation of Medical VLM Benchmark Construction

模型评测智能体系统Agent 协作评测方法与指标

摘要

借助丰富注释的成像数据集和大型语言模型 (LLM),大规模构建医学视觉语言模型 (VLM) 基准变得越来越可行,但现有的自动化主要侧重于在预定义的基准规范内生成评估项目。我们研究自动导出规范本身的更广泛的问题:评估什么,哪些注释支持每个任务,以及如何将这些证据转化为可靠的评估项目。我们将基准构建制定为约束编译,其中基准规范是从评估要求、异构注释和医学知识逐步导出的。基于此公式,我们引入了 MedBenchAgent,这是一个具有基准中间表示 (BIR) 的多代理框架,可对构建阶段的任务定义、证据映射、评估协议和项目规范进行编码。 MedBenchAgent 将规划(导出并验证规范)与实例化(构建和审核规范下的项目)分开。 锁定规格。 MedBenchAgent 的任务空间 F1 达到 90.9%,优于直接任务诱导 (79.2-80.0%) 和事先引导的诱导 (85.1%);从正确识别的任务中抽取的 1,000 个样本项目中有 994 个通过了人工审核。我们进一步证明了对专业医学领域的可移植性,并评估了 12 个 VLM,揭示了被总分掩盖的特定于任务和设置的变化。这些结果将约束编译建立为可扩展且可审计的框架,用于超越问题生成的医疗 VLM 基准构建。