论文
RealChart2Code:利用真实数据和多任务评估推进图表到代码的生成
RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation
摘要
视觉语言模型 (VLM) 在跨各个领域的代码生成方面展示了令人印象深刻的功能。然而,他们从现实世界数据复制复杂的多面板可视化的能力在很大程度上仍未得到评估。为了解决这一差距,我们引入了 \textbf{\texttt{RealChart2Code}},这是一个新的大规模基准测试,拥有超过 2,800 个基于真实数据集的实例,并具有具有明确分析意图的任务。至关重要的是,它是第一个系统评估大规模原始数据图表生成并评估多轮对话环境中迭代代码细化的基准。我们在 \texttt{RealChart2Code} 上对 14 个领先的 VLM 进行的综合评估显示,与更简单的基准相比,性能显着下降,突出了它们在复杂的绘图结构和真实数据方面的挣扎。我们的分析揭示了专有模型和开放权重模型之间的巨大性能差距,并证实即使是最先进的 VLM 也常常无法准确复制复杂的多面板图表。这些发现为了解 VLM 当前的局限性提供了宝贵的见解,并指导未来的研究方向。我们在 \url{https://github.com/Speakn0w/RealChart2Code} 发布了基准测试和代码。