论文

DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体

DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems

智能体系统Agent任务评测

摘要

最近基于大语言模型的数据代理旨在自动化从数据分析到深度学习的数据科学任务。然而,现实世界数据科学问题的开放性,通常跨越多种分类法并且缺乏标准答案,给评估带来了重大挑战。为了解决这个问题,我们引入了 DSAEval,这是一个基准,包含基于 285 个不同数据集的 641 个现实世界数据科学问题,涵盖结构化和非结构化数据(例如视觉和文本)。 DSAEval 包含三个显着特征:(1)多模态环境感知,使智能体能够解释来自包括文本和视觉在内的多种模态的观察结果; (2) 多查询交互,反映了现实世界数据科学项目的迭代和累积性质; (3) 多维评估,提供跨推理、代码和结果的整体评估。我们使用 DSAEval 系统地评估 11 个高级代理大语言模型。我们的结果表明,Claude-Sonnet-4.5 的整体性能最强,GPT-5.2 的效率最高,MiMo-V2-Flash 的性价比最高。我们进一步证明,多模态感知持续提高视觉相关任务的表现,增益范围从 2.04% 到 11.30%。总体而言,虽然当前的数据科学代理在结构化数据和常规数据分析工作流程上表现良好,但在非结构化领域仍然存在巨大挑战。最后,我们提供了重要的见解并概述了未来的研究方向,以推动数据科学代理的发展。

DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体
图2:DSAEval 概览。左:在 Data Collection Pipeline 中,原始案例经清理后使用先进的 LLM 合成为问题、推理与回答(QRA)对。中:Data Agent Pipeline 编排智能体在 Sandbox Environment 中解决任务。智能体接收多模态观测,并产出最终报告和一个 Jupyter notebook。右:Multi-Dimensional Evaluation 模块使用 Judge 模型,对照软性 ground truth 对推理、代码和结果进行评分,得到综合最终得分。