论文
语言转变是否会破坏医学视觉语言模型?印度尼西亚放射学视觉问答案例研究
Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study
摘要
医学视觉语言模型(VLM)通常在英语放射学视觉问答基准上进行评估,其在非英语临床语言下的稳健性很大程度上尚未得到探索。我们引入了 IndoRad-VQA(VQA-RAD 的印度尼西亚版本),用于评估医学 VLM 在用印度尼西亚语提出问题时是否保留放射学推理能力。放射学问答对被翻译成印度尼西亚语,并通过基于自我评估的质量控制来保持临床意义、术语一致性和答案等效性。我们在英语和印尼语提示设置下评估通用、东南亚多语言和医疗特定的 VLM。除了准确性之外,我们还量化了英语和印尼语输入之间的语言鲁棒性差距。我们还进行错误分析,以确定问答的失败模式,例如是/否翻转、偏侧性错误和输出语言不匹配。我们的研究结果表明,在英国医学 VQA 基准上的强劲表现并不一定意味着在印度尼西亚临床环境中的稳健行为。我们观察到英语和印度尼西亚语设置之间存在 8% 到 25% 的性能差距,具体取决于评估指标。这些结果凸显了对医学多模式基础模型进行更具包容性的多语言评估的必要性。该数据集可从 https://huggingface.co/datasets/Lab-IS/IndoRad-VQA 获取。