论文

DV-World:现实场景中数据可视化代理的基准测试

DV-World: Benchmarking Data Visualization Agents in Real-World Scenarios

智能体系统Agent任务评测

摘要

现实世界的数据可视化 (DV) 需要本地环境基础、跨平台演进和主动意图对齐。然而,现有的基准测试经常受到代码沙箱限制、仅限单语言创建任务以及完美意图假设的影响。为了弥补这些差距,我们引入了 DV-World,这是一个包含 260 项任务的基准,旨在评估现实世界职业生命周期中的 DV 代理。 DV-World 跨越三个领域: DV-Sheet,用于本机电子表格操作,包括图表和仪表板创建以及诊断修复; DV-Evolution 用于调整和重构参考视觉工件,以适应不同编程范式的新数据,而 DV-Interact 用于与模拟现实世界模糊要求的用户模拟器主动进行意图对齐。我们的混合评估框架将用于数值精度的表值对齐和用于语义视觉评估的 MLLM-as-a-Judge 与规则相集成。实验表明,最先进的模型总体性能不到 50%,暴露出在处理现实世界数据可视化的复杂挑战方面的严重缺陷。 DV-World 提供了一个现实的测试平台,可引导开发转向企业工作流程所需的多功能专业知识。我们的数据和代码可在 \href{https://github.com/DA-Open/DV-World}{此项目页面}获取。