论文

用于可靠医学视觉问答的 Wasserstein 平衡解码

Wasserstein Equilibrium Decoding for Reliable Medical Visual Question Answering

模型推理解码与生成控制

摘要

由于隐私限制、有限的连接性以及有利于设备上或本地推理的低延迟要求,小型视觉语言模型 (2-8B) 非常适合临床部署。然而,它们有限的能力加剧了看似合理但不正确的输出的产生。我们将之前仅限于纯文本、封闭式 NLP 任务的博弈论解码扩展到开放式医疗 VQA 的视觉语言模型。我们引入了语义感知的 Wasserstein 停止标准,它取代了词汇顺序匹配,实现了基于近同义候选答案之间的语义共识的收敛,并避免了临床等效排名交换引起的不必要的迭代。在 VQA-RAD 和 PathVQA 上,我们比贪婪和歧视基线获得了一致的、统计上显着的改进。在 VQA-RAD 上,我们将 Qwen3-VL-2B 提高了 +3.5 个百分点 (p < 0.01),超越了贪婪的 4B 模型,在更大的尺度上也有类似的趋势。在 PathVQA 上,尽管没有特定域的 微调,但具有 BDG 的 Gemma-3-4B 在贪婪解码下与 MedGemma-4B 匹配。在与经典 BDG 的精度相当的情况下,Wasserstein 准则将平均收敛迭代减少了约 20%,提高了推理效率,同时保留了博弈论平衡行为。代码可在 https://github.com/luca-hagen/Wasserstein-BDG-medical-VQA 获取。