论文
THEMIS:对 MLLM 进行科学论文欺诈取证的整体评估
THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics
摘要
我们推出了 THEMIS,这是一种新颖的多任务基准,旨在全面评估现实学术场景中视觉欺诈推理的多模态 大语言模型 (MLLM)。与现有基准相比,THEMIS 引入了三项重大进步。 (1) 真实世界场景和复杂性:我们的基准包括涵盖七个场景的 4,000 多个问题,这些问题源自真实的撤回论文案例和精心策划的多模式合成数据。 THEMIS 拥有 60.47% 的复杂纹理图像,弥合了现有基准与现实世界学术欺诈的复杂性之间的关键差距。 (2)欺诈类型多样性和粒度:THEMIS系统地涵盖了5种具有挑战性的欺诈类型,并引入了16种细粒度的操纵操作。平均而言,每个样本都会经历多次堆叠操作,这些操作的多样性和难度要求模型具有高水平的视觉欺诈推理能力。 (3)多维能力评估:我们建立了从欺诈类型到五种核心视觉欺诈推理能力的映射,从而能够进行评估,揭示不同模型在这些核心能力上的独特优势和具体弱点。在 16 个领先的 MLLM 上进行的实验表明,即使是性能最好的模型 GPT-5,整体性能也仅为 56.15%,这表明我们的基准测试经过了严格的测试。我们期望 THEMIS 能够推动 MLLM 的开发,以应对复杂的现实世界欺诈推理任务。