论文

TikZilla:用高质量数据与强化学习扩展 Text-to-TikZ

TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning

模型训练强化学习

摘要

大语言模型(LLM)日益被用于在多样工作流中辅助科学家。一个关键挑战是从文本描述生成高质量图形,这常以可渲染为科学图像的 TikZ 程序表示。既往研究为此任务提出了多种数据集与建模方法。然而现有 Text-to-TikZ 数据集太小且噪声大,难以涵盖 TikZ 的复杂性,造成文本与渲染图形间的失配。此外,既往方法仅依赖监督微调(SFT),模型接触不到图形的渲染语义,常导致循环、无关内容和空间关系错误等问题。为解决这些问题,我们构建 DaTikZ-V4,一个规模超过 DaTikZ-V3 四倍、质量显著更高的数据集,并以 LLM 生成的图形描述加以丰富。利用该数据集,我们训练 TikZilla,一系列小型开源 Qwen 模型(3B 与 8B),采用 SFT 后接强化学习(RL)的两阶段流水线。在 RL 阶段,我们利用经逆向图形学训练的图像编码器提供语义忠实的奖励信号。超过 1,000 次判断的大量人类评估显示,TikZilla 在 5 分制上较其基座模型提升 1.5-2 分,超出 GPT-4o 0.5 分,并在基于图像的评估中比肩 GPT-5,而模型规模小得多。

TikZilla:用高质量数据与强化学习扩展 Text-to-TikZ
图2:数据预处理工作流概览。我们首先主要从arXiv、GitHub、TeX SE以及合成数据获取TikZ图形程序。接着,应用基于规则的过滤技术,并对TikZ代码进行渲染。无法编译的代码会经历一个迭代调试过程,利用LLM结合错误消息尝试纠错。最后,使用VLM对所有可编译代码的图像进行描述。