论文
M2-Verify:用于检查多模式声明一致性的大规模多域基准
M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency
摘要
评估科学论证需要评估主张与其基础多模式证据之间的严格一致性。然而,现有的基准缺乏实际评估这种对齐所需的规模、领域多样性和视觉复杂性。为了解决这一差距,我们引入了 M2-Verify,这是一个用于检查科学主张一致性的大规模多模式数据集。 M2-Verify 源自 PubMed 和 arXiv,提供跨 16 个领域的超过 469K 个实例,并通过专家审核进行了严格验证。广泛的基线实验表明,最先进的模型很难保持稳健的一致性。虽然顶级模型在低复杂性的医疗扰动下实现了高达 85.8\% Micro-F1,但在解剖变化等高复杂性挑战上,性能下降至 61.6\%。此外,当模型为其对齐决策生成科学解释时,专家评估会暴露出幻觉。最后,我们展示了数据集的实用性并提供了全面的使用指南。