论文

DSGym:评估与训练数据科学智能体的整体框架

DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

智能体系统Agent任务评测

摘要

数据科学智能体许诺通过把数据转化为可执行的分析与发现来加速科学探索与洞见生成。然而,现有数据科学基准存在不足:碎片化的评估接口使跨基准比较困难,任务覆盖狭窄,且缺乏严格的数据接地。特别地,我们表明当前基准中相当大比例的任务可以在不使用实际数据的情况下被解决。为解决这些局限,我们提出 DSGym,一个在自包含执行环境中评估与训练数据科学智能体的标准化框架。与静态基准不同,DSGym 提供模块化架构,便于添加任务、智能体脚手架与工具,使其成为一个活的、可扩展的试验台。我们策展 DSGym-Tasks,一个通过质量与捷径可解性过滤标准化并精炼现有基准的整体任务套件。我们进一步以 (1) 扎根文献的专家导出生物信息学任务 DSBio 与 (2) 涵盖计算机视觉、分子预测与单细胞扰动等领域的挑战性预测任务 DSPredict 扩大覆盖。除评估外,DSGym 通过经执行验证的数据合成管线支持智能体训练。作为案例研究,我们构建 2,000 例训练集并在 DSGym 中训练一个 4B 模型,其在标准化分析基准上优于 GPT-4o。总体而言,DSGym 支持对智能体能否在真实科学情境中规划、实现与验证数据分析进行严格的端到端测量。

DSGym:评估与训练数据科学智能体的整体框架
图6:数据集构建流程。我们的数据构建流程从学术文献中精选领域特定的科学任务,并汇总来自 Kaggle 竞赛的真实世界预测建模挑战。