论文

HTMLCure:以浏览器交互状态指导页面修复

HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML

模型训练合成数据

摘要

LLM 现在可以生成完整的 HTML 页面,但其中许多页面只是表面上正确:它们渲染一次,然后在滚动、悬停、单击、调整大小或游戏时失败。通过屏幕截图进行评估可能会错过这些故障,并且过滤会丢弃许多仍可修复的页面。我们介绍 HTMLCure,一个浏览器体验框架,它在系统与 HTML 交互后对其进行评估。评估器跨视口和交互状态执行页面,记录确定性浏览器证据,并从执行的轨迹中提供 VLM 策划的关键帧,而不是孤立的屏幕截图。相同的状态信号驱动闭环修复引擎:HTMLCure 诊断当前页面,选择特定于状态的修复系列,再次运行每个候选,并为 SFT 导出通过质量检查的页面。在 97K 提示语料库上,这将直接可用的种子扩展为 63703 个通过质量检查页面的候选池,我们从中构建了最终的 40K 页面的精炼 SFT 集。在相同的主干和训练方案下,HTMLCure-27B-Refined 在 HTMLBench-400 上达到 50.6,确定性测试用例通过率为 45.2%,与 Kimi-K2.6 和 GPT-5.4 等强参考模型处于相同的性能范围。在发布的 MiniAppBench 验证拆分上,平均得分达到 81.2,将原始 27B SFT 提高了 15.3 分,接近强参考系统的水平。