论文
LLM 回答孟加拉医学视觉问题的能力如何?数据集和基准测试
How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking
摘要
大语言模型 (LLM) 和大视觉语言模型 (LVLM) 的最新进展使通用系统能够在复杂推理任务(包括医学领域的推理任务)中展示出有前景的能力。医学视觉问答(MedVQA)尤其受益于这些发展。然而,尽管孟加拉语是全球使用最广泛的语言之一,但尚无既定的 MedVQA 基准。为了解决这一差距,我们引入了 BanglaMedVQA,这是一个包含经过临床验证的图像-问题-答案对的数据集,以及对该资源上当前基础模型的综合评估。与先前报告的当前模型在英语 MedVQA 基准上表现不佳的研究结果一致,我们的分析表明孟加拉语的表现要低得多,反映了低资源语言固有的挑战。即使是 Gemini 和 GPT-4.1 mini 等性能最佳的模型也无法准确回答专门的诊断问题,这表明细粒度医学推理存在严重局限性。尽管某些开源模型(例如 Gemma-3)偶尔在一般类别中优于这些模型,但它们也难以解决临床复杂的问题,这凸显了对一流评估方法的迫切需要。