论文

SciFig:迈向自动化科学图形生成

SciFig: Towards Automating Scientific Figure Generation

应用与实践内容创作

摘要

为科学论文创建高质量的图形和可视化是一项耗时的任务,需要深厚的领域知识和专业的设计技能。尽管每年发表超过 250 万篇科学论文,但图表生成过程仍然主要是手动的。我们介绍 $\textbf{SciFig}$,这是一个端到端的人工智能代理系统,可以直接从研究论文文本中生成可供发表的管道图。 SciFig 使用分层布局生成策略,解析研究描述以识别组件关系,将相关元素分组为功能模块,并生成模块间连接以建立视觉组织。此外,迭代思想链(CoT)反馈机制通过多轮视觉分析和推理逐步改进布局。我们引入了基于评分标准的评估框架,分析 2,219 个真实的科学数据,提取评估评分标准并自动生成综合评估标准。 SciFig 表现出了卓越的性能:数据集级别评估的总体质量达到 70.1$\%$,论文特定评估的总体质量达到 66.2$\%$,并且在视觉清晰度、结构组织和科学准确性等指标上始终保持高分。 SciFig 图形生成管道和我们的评估基准将开源。

SciFig:迈向科学论文可编辑图示的自动生成 配图
图 2:SciFig 多智能体系统架构。我们的系统由三个阶段组成:分层布局生成(Hierarchical Layout Generation),其中描述智能体(Description Agent)解析研究文本,随后布局智能体(Layout Agent)将各组件组织为分层结构;迭代式 CoT 反馈(Iterative CoT Feedback),其中反馈智能体(Feedback Agent)分析渲染后的布局以识别具体问题,同时布局智能体运用思维链(Chain-of-Thought)推理在多轮中生成改进的布局;组件生成(Component Generation),其中组件智能体(Component Agent)以一致的样式渲染各个视觉元素,产出最终图形。本图由我们的系统起草并经人工润色。