论文
分析与缓解多语言医学视觉问答中的跨语言退化
Analyzing and Mitigating Cross-Lingual Degradation in Multilingual Medical VQA
摘要
医学视觉问答(VQA)是临床AI中的一项关键任务,然而其评估迄今几乎完全以英语为中心,限制了它对语言多元的患者与临床医生的相关性。近期的多语言医学VQA基准显示,大型视觉语言模型(LVLM)在非英语语言上出现退化,但缺乏对跨语言变化如何影响医学VQA所需的不同能力的细粒度分析。为此,我们构建了一个覆盖八种语言的多语言医学VQA基准,组织为四个代表性场景,以隔离医学VQA所需的核心能力。对五个开源与闭源LVLM的评估发现,跨语言退化并非均匀,而是高度依赖场景。因此我们提出MedVL-XLRepE,一种无需训练、场景感知的表示工程方法,利用LVLM在英语医学VQA上的更强能力,在推理时将非英语表示引导至其英语对应表示。在三个LVLM与八种语言上,MedVL-XLRepE持续缓解跨语言退化,提升最高达6.33%。
