论文
好分数,坏数据:多模态一致性的衡量标准
Good Scores, Bad Data: A Metric for Multimodal Coherence
摘要
多模态人工智能系统通过下游任务准确性来评估,但高精度并不意味着底层数据是连贯的。当模型的输入相互矛盾时,模型可以在视觉问答 (VQA) 上得分很高。我们引入了多模态一致性评分(MCS),这是一种独立于任何下游模型来评估融合质量的指标。 MCS 将一致性分解为四个维度:身份、空间、语义和决策,并通过 Nelder-Mead 优化学习权重。我们使用 DETR、CLIP 和 ViLT 对 1,000 张视觉基因组图像进行评估,并在没有重新训练的情况下对 150 张 COCO 图像进行验证。在三种融合架构中,MCS 区分质量的灵敏度比单独的任务准确性更高(Spearman rho = 0.093 vs. 0.071)。扰动实验证实每个维度都独立响应其故障模式,且串扰为零。 MCS 是轻量级的,不需要人工注释,并且不仅告诉您某些东西损坏了,而且还告诉您什么损坏了。