论文
多语言血液学视觉问答数据集
Multilingual Hematology Visual Question Answering Dataset
摘要
视觉语言模型 (VLM) 通过共同理解视觉问答等任务的视觉和文本信息,在医学图像分析方面显示出了有前景的能力。然而,现有的血液学视觉语言资源仍然主要以英语为中心,限制了它们在多语言医疗环境中的适用性。这一挑战普遍与南亚有关,特别是与巴基斯坦有关,尽管医疗信息和数字医疗系统在很大程度上依赖于英语,但乌尔都语在巴基斯坦被广泛使用。为了调查这一差距,我们对医疗保健专业人员进行了一项调查,结果显示临床文档和患者沟通之间存在严重的语言不匹配,强调了对多语言医疗保健技术的需求。为了解决这一限制,我们引入了 WBCMor VQA,这是一种经过临床验证的双语英语、乌尔都语形态感知 VQA 基准,用于白血病和正常白细胞分析。该基准是使用 LeukemiaAttri 和 WBCAt 数据集的形态感知注释构建的,并由特定领域的乌尔都语血液学词典支持,以确保语言一致性和临床正确性。最终基准测试包含 11 万个双语问答对,作为 2 万个白血病和正常单细胞图像的 VQA 注释。此外,我们通过根据建议的基准评估多个开源 VLM 来建立基准性能。拟议的资源旨在促进为多语言医疗环境开发可访问且与临床相关的人工智能系统。