论文

WebGen-R1:激励 大语言模型 通过强化学习生成功能和美观的网站

WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

模型训练强化学习

摘要

虽然 大语言模型 (LLM) 擅长功能级代码生成,但项目级任务(例如生成功能性和视觉美观的多页面网站)仍然极具挑战性。现有的工作通常仅限于单页静态网站,而代理框架通常依赖于专有模型的多轮执行,导致大量的词元成本、高延迟和脆弱的集成。使用强化学习 (RL) 端到端训练小型 LLM 是一种很有前途的替代方案,但它在为网站生成设计可靠且计算上可行的奖励方面面临着关键瓶颈。与可以通过单元测试验证的单文件编码任务不同,网站生成需要评估固有的主观美感、跨页面交互和功能正确性。为此,我们提出了 WebGen-R1,这是一个专为项目级网站生成量身定制的端到端 RL 框架。我们首先引入一种脚手架驱动的结构化生成范例,该范例限制大型开放式动作空间并保持建筑完整性。然后,我们设计了一种新颖的级联多模式奖励,将结构保证与基于执行的功能反馈和基于视觉的审美监督无缝结合起来。大量实验表明,我们的 WebGen-R1 基本上将 7B 基本模型从生成几乎不起作用的网站转变为生成可部署的、美观对齐的多页面网站。值得注意的是,我们的 WebGen-R1 不仅始终优于大规模开源模型(高达 72B),而且在功能成功方面可与最先进的 DeepSeek-R1 (671B) 相媲美,同时在有效渲染和美学对齐方面大幅超越它。这些结果使 WebGen-R1 成为将小型开放模型从功能级代码生成扩展到项目级 Web 应用程序生成的可行途径。