论文
WebGrader:用自进化程序化评分器训练面向Web开发的大语言模型
WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader
摘要
大语言模型越来越多地根据自然语言描述生成完整网站,强化学习已成为弥合其剩余功能差距的核心手段。这一训练范式受制于奖励设计。手工编写的浏览器脚本可执行,但对开放式需求而言编写成本高昂;VLM与GUI智能体评分器可扩展,但可能在观察到决定性状态之前就给出判定。我们提出WebGrader,一个自进化的程序化评分器,它从每个网站请求自主推导所需的交互流程,将每个流程表示为可执行的Flow Contract,并将其执行结果用作RL奖励。WebGrader在真实浏览器中实例化生成的项目,将目标动作基于源代码与实时DOM落地,并沿同一浏览器轨迹收集视觉、DOM、响应与持久状态证据。随后,残差驱动的离线循环发现可复用的验证器技能,在不相交的验证页面上筛选它们,并在策略训练前冻结被采纳的技能图。通过分离测试规划、动作落地、证据收集与语义判断,WebGrader只有在观察到所请求的转换后才给出Pass判定。在WebGen-Bench上,WebGrader将一个8B策略训练到52.01%的功能成功率,比匹配的外观加脚本奖励高出7.88个百分点,并超越o4-mini与DeepSeek-v4-flash。在WG-core-250上,该策略达到44.953的Full Score,超越Qwen3-Coder-480B。
