论文

超越静态图表:语言和视觉语言模型能否生成交互式数据可视化界面?

Beyond Static Charts: Can Language and Vision Language Models Generate Interactive Data Visualization Interfaces?

模型评测基准与评测资源

摘要

数据可视化是分析推理的核心,但现实世界的分析越来越需要语言驱动的交互界面而不是静态图表。尽管最近的大型语言和视觉语言模型(LLM/VLM)在从自然语言生成静态图表方面显示出了希望,但由于缺乏基准,它们生成交互式数据可视化界面的能力在很大程度上仍未得到探索。我们引入了 VIS-GEN,这是一个用于评估 LLM/VLM 从自然语言查询生成交互式可视化界面的能力的基准。 VIS-GEN 包含 3,042 个样本,涵盖不同的分析意图,包括数据过滤、时间分析和可视化编辑,每个样本都与数据集元数据和自然语言查询配对,旨在反映现实的、目标驱动的数据探索场景。我们对 14 个最先进的开源和闭源 LLM/VLM 进行了基准测试,揭示了涉及隐式意图、多种交互替代方案和复杂编辑操作的查询的巨大性能差距和频繁失败,强调交互式界面生成是超越静态图表合成的关键开放挑战。为了解决这个问题,我们提出了一个结构化的多阶段界面生成框架,该框架将任务分解为可视化设计表示、多个界面候选的生成、约束感知批评和自我改进。这种方法将最佳模型通过率提高了 15.9 个百分点,展示了通向更可靠的语言驱动交互式可视化系统的实用途径。我们在此 https URL 发布 VIS-GEN。