论文

Dashboard2Code:评估重建交互式仪表板的多模式模型

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

模型评测基准与评测资源

摘要

自动数据可视化生成通过多模式 大语言模型 迅速发展,但现有的工作主要集中在静态图表上,而忽略了通常用于现实世界数据探索的交互式仪表板。我们引入了 Dashboard2Code,这是一项新颖的任务,需要模型主动探索交互式仪表板,获取并集成来自其自身交互(例如单击和过滤)的反馈,并生成重现目标仪表板的代码。为了支持全面评估,我们推出了 DashboardMimic,这是 Dashboard2Code 的第一个 Plotly+Dash 基准测试,包含 180 个精心设计和手动验证的仪表板代码对,跨越三个难度级别,涵盖八种常见的现实世界交互模式。我们进一步提出了一种针对仪表板的自动化评估框架,该框架将代码语义分析与基于动态交互的测试相结合,以评估视觉和交互一致性,与人类判断表现出强烈的一致性。对一系列开源和闭源多模式模型的实验表明,即使是最强大的系统也会在高复杂性仪表板上陷入困境,并且在 Dashboard2Code 任务上开源和闭源模型之间仍然存在巨大的性能差距。