论文

DataClawEval:真实工业Harness中的数据工程智能体基准

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

模型评测AI 基础设施Sandbox基准与评测资源Agent Sandbox

摘要

大语言模型(LLM)与基于LLM的智能体正日益被部署用来自动化复杂工作流,有望变革数据管理与处理。然而,现有基准主要聚焦于简化的Text-to-SQL翻译或数据分析,端到端数据工程这一关键而复杂的领域在很大程度上未被探索。为弥合这一差距,我们提出DataClawEval,第一个专门评估自主智能体在真实数据工程场景中端到端任务完成能力的综合性基准。它基于专业企业数据工程师编写的生产级代码构建,包含100个严格的端到端任务,横跨五种执行引擎:PySpark、MySQL、HiveSQL、PrestoSQL/Trino和FlinkSQL。不同于非确定性的LLM-as-a-judge评分,每个任务在特定案例的隔离沙箱中执行,并由确定性的、基于规则的脚本评分。对16个前沿智能体的评估揭示了关键局限:最强模型仅获得74.9的总分,且没有单一模型占优——每个模型都在不同的引擎上各有所长,揭示出严格的领域专精化而非全能熟练。因此,自主数据工程仍然是一个艰巨的未解难题。我们在 https://github.com/Dicemy/DataClawEval/tree/master 发布数据集、容器化环境和确定性评测脚本。

DataClawEval:真实工业Harness中的数据工程智能体基准:论文配图
图 2. DataClawEval 的两个耦合管道概述。顶部(数据集构建):对真实数据工程代码进行清理和采样以创建基准任务。 LLM 综合用户意图和输入表,并通过代理在循环执行和专家扰动进行迭代验证。然后,针对特定案例的评分者和领域专家验证任务的正确性、可辨别性和质量。底部(代理评估):对于每种情况,代理在隔离的 Docker 环境中运行以生成可执行代码和输出表。特定案例的评分者评估生成的工件并分配最终分数。