论文

WebWorld:浏览器作为自我改进 Web 代码的世界模型

WebWorld: The Browser as a World Model for Self-Improving Web Code

模型训练合成数据

摘要

VLM 驱动的 Web 代码自我改进存在一个结构性缺陷:提出修复的模型是对其进行判断的模型,而该判断下的视觉合理性并不能很好地代表页面是否真正有效。循环所缺少的是 VLM 无法欺骗的对手方,而浏览器已经是该对手方:一个确定性的可执行模拟器,用于描述 HTML 工件在用户操作下的行为方式,以及除了 Web 代码的世界模型之外的所有内容。我们提出了 WebWorld,这个接口让 VLM 能够预先与这个浏览器世界模型自主交互,并决定哪些交互成为监督。每一轮,VLM 都会发出一个批评,规划者将其编译成一个类型化的交互契约;仅当目标进度和每个先前验证的能力的保留都成立时,浏览器才重新执行候选程序并颁发接受证书;经过认证的转换会积累为质量棘轮,这是 SFT 导出所见过的唯一的东西。在匹配训练下,WebWorld-27B在HTMLBench-400上比Raw-27B提高了5.3分,在MiniAppBench-Val上提高了14.9分,在交互式HTML生成上达到了Kimi-K2.6和GPT-5.4等强前沿系统的水平。同等规模的消融表明,浏览器支持的准入带来了好处:如果没有证书,匹配的 9B 提升几乎消失。