论文

DSAgentBench:智能体能在真实计算机环境中自动化端到端数据科学工作流吗?

DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?

智能体系统Agent任务评测长程任务评测

摘要

现实世界的数据科学涉及跨越数据整理、探索、建模、可视化和验证的长程工作流,并需要在真实操作环境中协调使用notebook、IDE、终端、浏览器和数据库等工具。然而,现有基准缺乏真实计算机交互,无法评估智能体能否在现实计算环境中执行完整的端到端数据科学工作流,未能刻画数据科学实践的多阶段、多工具特性。我们提出DSAgentBench,首个评估智能体能否在真实计算机环境中自动化完整数据科学工作流的基准。DSAgentBench包含275个覆盖数据科学生命周期全过程的多样化任务,反映了实践中的复杂性与工具协调要求。每个任务要求基于中间输出做出锚定决策并协调使用工具,并配有确定性评估器,验证分析正确性、可视化输出和模型性能,而不仅是代码能否执行。我们对15个闭源与开源模型的广泛实验表明,即使最强的智能体Claude-4.6-Sonnet也仅取得56.70%的任务成功率,而所有开源智能体均低于1%,常在工具编排、操作系统锚定和多步推理上失败。这些结果揭示了当前agentic系统与真实数据科学工作流之间的巨大能力差距,将DSAgentBench定位为开发锚定、可验证、自主数据科学智能体的基础。我们在https://github.com/vis-nlp/DSAgentBench发布DSAgentBench。

DSAgentBench:智能体能在真实计算机环境中自动化端到端数据科学工作流吗?:论文配图
图1:DSAgentBench中的智能体工作流任务示例,展示多步工作流中的若干选定阶段:智能体检索数据、执行代码并产出最终输出。所示轨迹由GPT-4o生成。