代码版的不完美视觉验证:TikZ 案例研究
Imperfect Visual Verification for Code Edition : A Case Study on TikZ
摘要
LLM 具有显着先进的代码生成功能,可实现功能程序的综合。虽然最近的系统在许多编码基准上实现了强大的性能,但涉及生成视觉工件的 TikZ 等程序的任务仍然具有挑战性,特别是在视觉代码定制方面。与从头开始生成不同,定制需要本地化、保留语义的编辑:模型必须找到相关代码,根据指令进行修改,并保留剩余的结构和渲染。基于事后迭代细化/修正的方法已显示出希望,其中验证者提供反馈来指导修正。然而,对于具有视觉结果的程序(例如 TikZ),其正确性更难或可能不可能自动形式化和评估,因此不存在确定性验证器。因此,开发者只能依赖不完善的验证者。在本文中,我们进行了实证研究来回答:当验证者本身不可靠时,迭代细化在多大程度上可以保持有效?}我们使用 TikZ 作为重点案例研究,在受控和具有挑战性的环境中隔离问题的核心困难(弱代码结构、细粒度视觉语义和困难的特征定位)。我们将可视化代码定制定义为具有不完美预言的迭代编辑问题,并引入了用于分析此类迭代改进的框架。我们进行了大规模研究,并在迭代细化流程中评估了多个基于 LLM 和工具增强的视觉验证器,并对细化轨迹进行了广泛的手动注释,以评估验证器的行为和反馈质量。我们的研究结果表明,即使是不完美的验证者也可以以中等准确度确定视觉指令是否应用于代码,实现高达 0.815 的 F1 分数。反馈改进了迭代细化,特别是对于较弱的模型,为 Qwen3-vl-30b-a3b-Instruct 添加了 11--20 个完美定制,而像 Gemini-3 这样的更强模型获得的改进较少 (+5),但从防止过早接受的准确验证中受益更多。只有当反馈能够准确识别图像问题、提供可操作的指导、解决所有相关问题并以原始指令为基础时,反馈才有效。