论文

DEEPCHART:LLM距离忠实的数据科学图表生成还有多远?

DEEPCHART: How Far are LLMs from Faithful Data-Science Chart Generation?

模型评测基准与评测资源

摘要

在真实世界数据科学工作流中,忠实的图表生成需要将可视化建立在分散的证据之上、计算可直接绘制的数值并准确渲染。现代LLM可以生成视觉上可信、符合指令的图表,但在冗长、嘈杂和多模态的上下文中,数据层面的幻觉仍难以察觉。为度量这一差距,我们提出DEEPCHART,一个由专家标注的基准,包含1,482个任务条件化的图表生成实例,取自真实的科学论文、财务申报文件和生态报告。DEEPCHART将图表生成形式化为“提取—推理—可视化”流水线,并逐阶段评估源数据提取、派生数据推理和图表渲染。对最先进模型的实验表明,视觉上可信的图表常常掩盖数据层面的幻觉,在真实的冗长和多模态场景中,提取与推理错误很常见。这些发现表明,仅靠更大的上下文窗口并不足够;忠实的图表生成还需要在渲染之前进行可靠的证据提取和定量推理。基准与相关资源已在https://github.com/tangdouer1005/DeepChart公开。

DEEPCHART:LLM距离忠实的数据科学图表生成还有多远?:论文配图
图1:DeepChart 任务概览。与仅可视化类图表基准相比,DeepChart 将图表生成作为长篇多模态文档上的提取–推理–可视化(Extract–Reason–Visualize)流程进行评估。