论文

SciForma:结构忠实地生成科学图表

SciForma: Structure-Faithful Generation of Scientific Diagrams

模型训练偏好优化

摘要

结构保真度对于科学方法图至关重要。为了传达研究逻辑,这些图表必须忠实地呈现组件、方向关系和文本注释。由于单个错误(例如反向箭头或不可读的方程)可能使整个图形无效,因此结构保真度本质上是结合性的:一个轴上的正确性无法补偿另一轴上的错误。当前的开源模型无法满足这一标准。受监督的 微调 (SFT) 学习合理的布局,但无法可靠地确保结构正确性,而基于标量奖励的 后训练 会掩盖哪个结构维度失败。为了解决这个问题,我们引入了 SciForma,一个用于结构忠实地生成科学方法图的框架。具体来说,SciForma 在结构清单的指导下将图表质量分解为三个结构轴:组件、箭头和文本。在此基础上,我们策划了用于结构化训练的 SciFormaData-700K 和用于逻辑验证评估的 SciFormaBench-2K。为了弥补 SFT 留下的差距,我们开发了多维联合偏好优化 (M-DPO),它强制所有轴同时正确,并自适应地将梯度路由到 后训练 中最不足的维度。相同的结构清单还可以在推理时进行迭代编辑以纠正残留错误。这种组合使 SciForma-9B 在 SciFormaBench-2K 和 AIBench 上超越所有开源基线和 GPT-Image-1.5,使开放科学图表生成接近专有级别的结构保真度。我们的代码和数据将在以下位置提供:https://github.com/microsoft/SciForma。