论文
波兰语医学视觉问答:视觉语言模型未充分利用视觉证据
Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence
摘要
我们提出一个波兰语医学视觉问答(VQA)基准,其题目来自波兰专科认证考试中面向执业医师以及寻求专科认证的牙医的考题。该基准包含涵盖多样医学专科和视觉领域的带图问题,并配有纯文本问答(QA)对照集。我们评估了波兰语导向、通用开放权重和商业视觉语言模型。该任务仍然困难:最佳模型在完整 VQA 集上取得 79.0% 的准确率,而在提供候选回答的子集上,只有 GPT-5.6 超过了近似人类参考,其他所有受评模型的表现都不如人类。为评估视觉定位能力,我们将完整输入与省略图像、省略问题或两者皆省略的配置进行比较,并按图像重要性对问题分类。模型从问题文本中获得的有用信息多于从图像中获得的信息,并且在图像主导的问题上表现更差。在 QA 和 VQA 中,模型仅凭答案选项就能取得高于随机水平的准确率,这表明即使缺失关键任务成分,不容忽视的性能仍可存在。
