论文

对复杂交互式网页的代码生成进行多模式 LLM 基准测试

Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 的最新进展在多模态推理和代码生成方面取得了显着进展,催生了前端开发的新范式。特别是,这些模型可以直接将视觉设计转化为可执行代码,显着提高Web开发的效率和适应性。现代 Web 应用程序是动态的、交互式的,具有频繁的用户页面交互的特点。然而,现有的基准测试主要评估静态网页的代码生成,忽略了现实应用程序中复杂的交互行为。此外,他们的评估标准仍然局限于视觉保真度和代码结构,忽略了生成的网页和参考网页之间的交互一致性。为了解决这些限制,我们引入了 WebIGBench,这是第一个旨在评估具有复杂交互的交互式网页的代码生成的基准测试。通过将手动设计的交互路径与 UI 自动化相结合,我们从现实世界的网站中收集了 103 个复杂的网页。该基准测试涵盖 5 种流行的交互操作类型(例如点击、输入),涉及 871 个不同的交互操作。此外,我们提出了一种新颖的评估管道来解决交互动作自动评估方面的差距。对几个代表性 MLLM 的大量实验揭示了使用 WebIGBench 生成交互式网页代码的当前模型的性能边界。建议的基准可在 https://github.com/anoa12159-hue/WebIGBench_eval 上获取。