论文

面向前端代码生成的视觉引导迭代精炼

Vision-Guided Iterative Refinement for Frontend Code Generation

模型推理推理验证与自校正

摘要

用大语言模型进行代码生成往往依赖多阶段的人在回路精炼,这虽然有效但成本很高——尤其是在前端网页开发这类解的质量取决于渲染视觉输出的领域。我们提出一个全自动的评论家在回路框架,其中视觉语言模型(VLM)充当视觉评论家,对渲染后的网页提供结构化反馈,以引导生成代码的迭代精炼。在来自WebDev Arena数据集的真实用户请求上,该方法带来了解决方案质量的持续提升,经过三轮精炼性能最高提升17.8%。接着,我们利用LoRA研究参数高效微调,以了解评论家带来的改进能否被代码生成LLM内化。微调在不显著增加token数量的前提下,取得了最佳评论家在回路方案25%的收益。我们的发现表明,基于VLM的自动化批评使前端代码生成获得的质量显著高于单次LLM推理所能达到的水平,并凸显了迭代精炼对网页开发这类复杂视觉输出的重要性。

面向前端代码生成的视觉引导迭代精炼:论文配图
图 1:左:用于 Web 代码生成的批评者循环 (CITL) 管道的概述。右(上):总体得分与token使用情况,说明了整个细化周期的质量与效率权衡。右(下):VLM 评判的绩效在四个评估维度上的细分。性能数据基于 Distill-Qwen-14B 发电机模型。