论文
UltraG-Bench:超声视觉语言模型的像素证据基准
UltraG-Bench: A Multi-task Benchmark for assessing Large Vision-Language Models on Pixel-level Evidence Grounding in Ultrasound
摘要
超声是最广泛使用的医学成像方式之一,最近的大型视觉语言模型(VLM)显示出超声图像理解能力的不断增强。然而,这些模型无法提供与其语义预测一致的像素级视觉证据,并且它们在超声中的细粒度定位能力在很大程度上仍不清楚。我们推出 UltraG-Bench,这是一种用于评估超声像素级证据定位的大规模多任务基准。 UltraG-Bench 是通过注释跨越 13 个解剖类别的 40 个公共超声分割数据集构建的,包括三个渐进任务:指令引导分割、基于证据的 VQA 和基于证据的报告生成,分别有 331125、666779 和 138832 个注释。对 14 个最先进模型的综合评估揭示了语义理解和细粒度像素级定位之间的巨大差距。我们进一步提出了 UltraG-Agent,它将 VLM 的语义推理功能与 UltraSAM3 的超声特定分割功能相结合。实验表明,UltraG-Agent 极大地改善了语义预测和像素级视觉定位。我们的数据集和代码可在 https://github.com/zhuqh19/UltraG-Bench 获取。
