论文

AI能画出科学吗?通过文本到图像和多模态模型评估科学图形生成的基准

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models

模型评测基准与评测资源

摘要

文本到图像和多模态生成模型越来越多地用于生成科学图形,例如机制图、实验设计示意图、概念框架和图形摘要。然而现有的图像生成基准(例如 GenEval、T2I-CompBench、DPG-Bench)评估自然图像并测量构图、对象计数或照片写实度。它们都没有衡量生成的科学图形的可用性:正确且清晰的文本标签、对实体及其关系的忠实描述、连贯的图表结构以及对学科绘图惯例的遵守。我们推出了 SciDraw-Bench,它是涵盖 8 种图形类型和 10 个学科的 32 个结构化科学图形生成任务的基准,其中每个任务将自然语言提示与所需标签、关系、组件、约定和负面约束的机器可检查规范配对。我们提出了一个四维评估协议:文本保真度(基于 OCR 的标签召回率和字符错误率)、语义正确性(根据规范判断的视觉语言模型)、结构质量和约定遵守度,以及元评估协议和初步的法官间可靠性分析(人类评级验证正在进行中)。我们根据代表性的通用文本到图像模型评估了特定领域的系统 SciDraw AI,并概述了代码到图形基线作为计划的扩展。在所有八种图形类型的试点中,特定领域系统在每个维度和图形类型上都大大优于通用基线,在语义正确性和约定遵守方面差距最大;文本保真度仍然是所有系统中最难的一个维度。