论文

MV-Bench:协调多视图界面构建的多模态 大语言模型 基准测试

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

模型评测基准与评测资源

摘要

人们越来越期望多模态 大语言模型 (MLLM) 通过直接从可视化设计生成代码来自动化可视化开发。然而,现有的评估主要集中在单图表生成上,而忽视了协调的多视图界面构建,这需要数据语义、视图协调和交互逻辑的联合推理。因此,MLLM 在这种情况下的能力仍未得到充分开发,并且该领域缺乏系统评估的专用基准。我们引入了 MV-Bench,它是评估 MLLM 在协调多视图界面构建方面的基准。我们不依赖不完整或不一致的开源实现,而是使用 Tableau 工作簿文件作为 真值,因为它们显式编码数据绑定、可视化映射和交互。我们开发了一个多级管道,通过结构化中间表示将这些规范转换为可执行的 Web 界面。该基准测试包含 92 个基本接口和 1,048 个通过重新组合图表类型、数据集和交互模式创建的经过验证的实例。每个实例包括可执行代码、呈现的界面、数据集和交互注释。我们使用视觉保真度、数据绑定正确性和交互完整性指标在单通道设置中评估五个最先进的 MLLM。最强的模型在视觉布局再现方面达到了 75.45% 的准确率,但在数据绑定方面仅为 21.71%,在交互完整性方面仅为 11.68%。这些结果表明,当前的 MLLM 可以再现视觉外观,但在生成协调多视图界面所需的数据语义和交互逻辑方面仍然受到限制。迭代细化提高了代码的可执行性,但并没有实质性地减少数据绑定和交互生成方面的差距。