论文

您的简答 VQA 分数实际衡量的是什么?多模态简答基准中评估者相关的不稳定性

What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

模型评测评测方法与指标

摘要

简答 VQA 基准合并了两个不同的量:模型的答案在语义上是否正确,以及该答案是否与自动评估器期望的表面形式匹配。我们研究了六个视觉语言模型和六个基准的这种合并,使用经过人工验证的语义判断(97.6% 的精度)来审核超过 37,000 个官方错误。第二个纯文本判断再现了相同的基准级别假阴性模式,表明该效果不是单一审计模型的产物。在文本丰富的基准测试中,多达一半的错误是语义上可接受的答案,纯粹因为表面形式不匹配而受到惩罚。这种不稳定性是由答案类型决定的:提取式和多跨度答案比标量答案对评估者更加敏感。良性的提示和背景重写进一步破坏了官方结果的稳定性,在不改变基本任务的情况下大幅改变了项目级别的正确性。确定性的仅 CPU 合同修复确认计数不足是可以部分恢复的。这些发现意味着官方简答 VQA 分数应伴有语义审核和答案类型诊断,以保持可解释性。