论文

EdiTikZ:基于修订轨迹的科学图形编辑

EdiTikZ: Scientific Figure Editing from Revision Trajectories

应用与实践模型训练强化学习内容创作Agentic RL

摘要

视觉语言模型(VLM)在从文本或图像生成科学图形方面表现出了强大的性能。然而,生成可供出版的图表需要迭代细化,这使得科学图表编辑成为一项重要但很大程度上尚未探索的任务。现有方法依赖于昂贵的专有代理系统,主要侧重于评估,或从综合生成的编辑中构建训练监督。相反,我们利用自然发生的科学修订和发展轨迹作为可扩展的监督来源。为此,我们引入了 DaEdiTikZ,这是第一个基于修订的科学图形编辑的大规模数据集,通过从 arXiv、GitHub 和 TeX SE 挖掘 391K 合理的 TikZ 编辑对并使用以渲染图形和 TikZ 代码为条件的 VLM 推断 781K 定向编辑指令来构建。我们进一步引入 DaEdiTikZ-Bench,这是一个具有 790 个实例的人工改进基准,并通过联合学习重建和编辑来训练两个基于 Qwen3.5 的紧凑型 EdiTikZ 模型(4B 和 9B),然后进行强化学习(RL),并为渲染保真度和编辑应用程序提供补充奖励。自动评估使我们的 9B 模型高于所有测试的基线,而使用 9 个注释者和 4,320 个评分进行的人工评估使其高于 GPT-5.6-Sol 并与 Gemini-3.1-Pro 相当。在严重的分布外变化下,它在接近 2K 训练序列长度的情况下仍然与 GPT-5.6-Sol 具有竞争力。模型和数据集将被发布。

EdiTikZ:基于修订轨迹的科学图形编辑:论文配图
表1:GPT-5.6-Sol和我们的EdiTikZ-9B模型在RL之前/之后编辑的科学数字。每个模型都接收源图像和 VLM 生成的编辑指令 。人文注释为编辑应用程序(E)、源码保存(P)和视觉质量(Q)提供分数。总体来说:非常好,很好,很糟,非常糟糕。显示地面实况数据供参考。