论文
它到处渲染吗? MLLM生成网页的跨环境兼容性研究
Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages
摘要
多模式 大语言模型 (MLLM) 已被越来越多地采用来自动从视觉设计(例如屏幕截图)生成网页。然而,现有的评估仅限于固定浏览器设备配置下的视觉保真度评估。这样的设置忽略了实际部署的跨环境渲染兼容性。为了解决这一差距,我们首次对人工智能生成的网页的跨环境兼容性进行了系统的实证研究。具体来说,我们构建了 WebCompat,一个包含 2,032 个带注释实例的数据集,其中包括由 8 个代表性 AI 工具生成的网页,每个工具都在 9 个浏览器和设备组合上呈现。我们分析兼容性问题的普遍性、用户可感知的症状以及潜在的代码级根本原因。我们的研究结果表明,68% 的生成网页至少存在一个兼容性问题,这凸显了围绕 MLLM 生成的前端工件的普遍可靠性问题。最常见的症状是破坏整个页面布局的故障(88.3%):页面直接缩小以适应目标屏幕,字体太小,或者表现出比例不匹配,导致内容被截断。仅限于单个元素的故障(例如图像失真或缺少组件)相对较少见(13.4%)。此外,尽管大多数 MLLM 将响应式设计模式融入到生成中,但它们无法正确实现这些代码。在这些发现的指导下,我们开发了 XCompat,一个轻量级的离线兼容性问题检测器,结合了可视化屏幕截图和结构 DOM 树进行分析。它在 WebCompat 测试中获得了 0.903 的 F1 分数,优于现有的兼容性检查工具和 LLM 基线。所有数据集和工具的发布都是为了支持基于 MLLM 的前端代码生成中渲染可靠性的未来研究。