论文

WebCompass:面向代码语言模型的多模式 Web 编码评估

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

模型评测基准与评测资源

摘要

大语言模型 正在迅速发展为能够进行端到端 Web 编码的交互式 编码智能体,但现有的基准测试仅评估此功能的一小部分,通常是具有静态正确性指标的文本条件生成,而视觉保真度、交互质量和代码库级推理在很大程度上无法衡量。我们推出了 WebCompass,这是一个多模式基准测试,可提供 Web 工程能力的统一生命周期评估。认识到现实世界的网络编码是生成、编辑和修复的迭代循环,WebCompass 涵盖了三种输入模式(文本、图像、视频)和三种任务类型(生成、编辑、修复),产生了反映专业工作流程的七个任务类别。通过多阶段、人机交互管道,我们管理了涵盖 15 个生成域、16 种编辑操作类型和 11 种修复缺陷类型的实例,每个实例都按简单/中/困难级别进行注释。为了进行评估,我们采用检查表引导的 LLM-as-a-Judge 协议进行编辑和修复,并提出了一种新颖的 Agent-as-a-Judge 生成范式,在真实浏览器中自主执行生成的网站,通过模型上下文协议(MCP)探索交互行为,并迭代合成目标测试用例,非常接近人类验收测试。我们评估了代表性的闭源和开源模型,并观察到:(1)闭源模型仍然更加强大和更加平衡; (2) 编辑和修复表现出不同的难度特征,修复可以更好地保持交互性,但仍然具有执行挑战性; (3)美观是最持久的瓶颈,尤其是对于开源模型; (4) 框架选择会对结果产生重大影响,Vue 始终具有挑战性,而 React 和 Vanilla/HTML 根据任务类型表现更强。