论文

LiveEvalBench:面向网页生成的开放世界评估

LiveEvalBench: Toward Open-World Evaluation for Web Generation

模型评测评测方法与指标

摘要

大语言模型正变得越来越有能力生成可执行的前端项目,但现有的基准测试仍然将网页生成视为静态评估问题。我们认为前端成果需要一种不同的范式:它们是交互式的而非静态的,允许各种有效的实现,并且比僵化的管道更快地进化。为解决这些差距,我们提出了LiveEvalBench,这是一个自动化的框架,将网页生成评估重新定义为一个适应性、可扩展和灵活的过程。LiveEvalBench将评估作为协作审查工作流来实施,其中构建工程师、代码工程师和用户界面测试员共同收集前端项目的整个生命周期证据,从部署到代码检查再到浏览器上的交互。为了处理实现多样性,一个自适应协议结合了共享的基准用于跨模型可比性与针对每个成果定制化的实现标准。该框架进一步支持在不重设计管道的情况下逐步集成新的评估角色和评估维度。我们在不同的真实世界网页生成场景下的实验结果表明,LiveEvalBench非常接近人类专家的判断,并为前沿模型的网页生成能力提供了精细的见解。代码可在https://github.com/wyysteelhead/LiveEvalBench处获取。

LiveEvalBench:面向网页生成的开放世界评估:论文配图
图 1:LiveEvalBench 与之前的 Web 编码基准对比。虽然之前的工作将评估视为一次性评分程序,但 LiveEvalBench 将其建模为具有互补代理、自适应协议和可扩展框架的协作专家评审工作流程。