论文
Edit2TikZ:使用 TikZ 进行科学图形编辑的全面且具有挑战性的基准
Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ
摘要
尽管多模态 大语言模型 (MLLM) 在视觉理解和图形代码生成方面显示出巨大的潜力,但通过代码编辑科学图形提出了更大的挑战:模型必须共同恢复视觉结构、根据请求的更改、生成可编译代码并保留所有不相关的内容。虽然现有的 TikZ 基准测试主要关注图形重建和生成,但很少系统地评估使用可编译代码的指令引导的科学图形编辑。我们推出了 Edit2TikZ,这是一个针对科学图形编辑任务的综合基准测试,具有 1,548 个多样化的高质量样本。 Edit2TikZ结合了真实世界和受控合成编辑案例,支持文本和视觉本地化请求,并包含多步骤编辑,每个步骤都带有步骤级注释。我们进一步构建了一个人性化的评估框架,以衡量是否完成了请求的编辑,同时保留了不相关的内容。利用 Edit2TikZ,我们评估了 14 个主流 MLLM,发现当前系统仍然不可靠:平均而言,专有模型的编译成功率仅为 75%,并且在图形恢复和编辑正确性方面仍然有限,而低于 9B 的紧凑模型在指令跟踪和完整图形生成方面更加困难。因此,我们构建了一个混合训练集 TikZEditMix,并针对紧凑模型采用重构然后编辑的课程学习。在 Qwen3.5-4B 上,这种训练将编译成功率从 45.35% 提高到 83.40%,并且在我们提出的评估指标中平均提高了 18.7 个百分点。代码和数据将在https://github.com/Solunny/Edit2TikZ发布。