论文

GENFIG1:学术工作的视觉摘要作为视觉语言模型的挑战

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

模型评测基准与评测资源

摘要

在许多科学论文中,“图1”作为核心研究思想的主要视觉总结。这些图形视觉上简单但概念丰富,通常需要人类作者付出巨大的努力和迭代才能正确,这凸显了科学视觉传达的难度。凭借这种直觉,我们引入了 GENFIG1,它是生成式 AI 模型(例如视觉语言模型)的基准。 GENFIG1 评估模型生成图形的能力,这些图形能够清楚地表达和激发论文的中心思想(标题、摘要、引言和图示说明)作为输入。解决 GENFIG1 需要的不仅仅是生成视觉上吸引人的图形:该任务需要推理文本到图像的生成,将科学理解与视觉合成结合起来。具体来说,模型必须(i)理解和掌握论文的技术概念,(ii)识别最突出的概念,以及(iii)设计连贯且美观有效的图形,以视觉方式传达这些概念并忠实于输入。我们根据顶级深度学习会议上发表的论文制定基准,应用严格的质量控制,并引入与专家的判断良好相关的自动评估指标。我们评估了 GENFIG1 上的一组代表性模型,并证明该任务即使对于性能最佳的系统也提出了重大挑战。我们希望这个基准能够成为多模式人工智能未来进展的基础。