论文

测量和提高内窥镜 VQA 中复杂原子答案的一致性

Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA

模型评测基准与评测资源

摘要

内窥镜视觉问答 (VQA) 越来越多地提出复杂的问题,这些问题结合了多个内窥镜答案组件,而不是孤立的事实查询。即使相同的模型在相关的原子问题上失败,这种复杂的答案也可能被评分为正确。我们引入了 EndoCA,这是一种配对的复杂原子答案一致性基准,用于评估复杂答案是否与同一图像原子答案保持一致。 EndoCA 包含两个套件:EndoCA-Core 评估实际内窥镜 VQA 中常见的紧凑问题复杂性模式,EndoCA-Diagnostic 支持针对不断增加的问题复杂性进行受控分析。我们在 EndoCA 上评估了 11 个 VLM,涵盖开放、医学、内窥镜适应和闭源模型。一些 VLM 实现了较高的复杂答案准确性,但其原子答案准确性和复杂原子答案一致性仍然很低。为了减少这种复杂原子不一致,我们引入了原子支持协调(ASR),这是一种 无需训练 机制,它使用模型生成的原子答案作为答案修订和一致性引导选择性回答的上下文前提。在四个选定的公开可用模型上,ASR-Revise 通过适度改变复杂答案准确性来提高配对复杂原子正确性,而 ASR-Selective 通过允许模型放弃不太可靠的案例来提高已回答案例的准确性。 EndoCA 和 ASR 共同提供了一致性感知基准和 无需训练 机制,用于内窥镜 VQA 中的答案协调和选择性回答。