论文
SciVisAgentBench:科学数据分析与可视化智能体评估基准
SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents
摘要
大语言模型(LLM)的最新进展使智能体系统能够将自然语言意图转化为可执行的科学可视化(SciVis)任务。尽管进展迅速,社区仍缺乏一个原则性且可复现的基准,用于在现实的多步分析场景中评估这些新兴的 SciVis 智能体。我们提出 SciVisAgentBench,一个用于评估科学数据分析与可视化智能体的综合性、可扩展基准。我们的基准建立在涵盖应用领域、数据类型、复杂度级别与可视化操作四个维度的结构化分类体系之上。它目前包含108个由专家编制的案例,覆盖多样的 SciVis 场景。为实现可靠评估,我们引入一个以结果为中心的多模态评估流水线,将基于 LLM 的评审与确定性评估器相结合,包括基于图像的指标、代码检查器、基于规则的验证器以及针对具体案例的评估器。我们还与12位 SciVis 专家开展了一项效度研究,以检验人类评审与 LLM 评审之间的一致性。利用该框架,我们评估了代表性的 SciVis 智能体与通用编码智能体,建立了初步基线并揭示了能力差距。SciVisAgentBench 被设计为一个持续演进的活基准,以支持系统性比较、诊断失败模式并推动智能体化 SciVis 的进展。该基准发布于 https://scivisagentbench.github.io/。
