论文

通过对偶自洽强化学习进行科学图形程序合成

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

模型训练强化学习

摘要

图形程序合成对于解释和编辑视觉数据至关重要,可有效促进将静态视觉效果逆向工程为可编辑的 TikZ 代码。虽然 TikZ 由于其编程灵活性而成为科学原理图事实上的标准,但其对严格空间精度的要求对 Multimodal 大语言模型 提出了重大挑战。目前进展受到两个主要差距的阻碍:(1)数据质量差距:现有的图像-TikZ 语料库通常缺乏严格的可执行性和可靠的视觉对齐; (2) 评估差距:缺乏结构和视觉保真度的基准。为了解决这些问题,我们提出了一个闭环框架,其特点是: SciTikZ-230K,来自我们以执行为中心的数据引擎的大规模、高质量数据集,涵盖 11 个不同的科学学科; SciTikZ-Bench,一个多方面的基准,涵盖从基本几何构造到复杂的分层示意图,用于评估视觉保真度和结构逻辑。为了进一步扩大可视化代码优化方法的范围,我们引入了一种新颖的双重自一致性强化学习优化范例,它利用往返验证来惩罚退化代码并提高整体自一致性。在这些的支持下,我们经过训练的模型 SciTikZer-8B 实现了最先进的性能,始终优于 Gemini-2.5-Pro 等专有巨头和 Qwen3-VL-235B-A22B-Instruct 等大型模型。