论文
DataClawEval:真实工业Harness中的数据工程智能体基准
DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness
摘要
大语言模型(LLM)与基于LLM的智能体正日益被部署用来自动化复杂工作流,有望变革数据管理与处理。然而,现有基准主要聚焦于简化的Text-to-SQL翻译或数据分析,端到端数据工程这一关键而复杂的领域在很大程度上未被探索。为弥合这一差距,我们提出DataClawEval,第一个专门评估自主智能体在真实数据工程场景中端到端任务完成能力的综合性基准。它基于专业企业数据工程师编写的生产级代码构建,包含100个严格的端到端任务,横跨五种执行引擎:PySpark、MySQL、HiveSQL、PrestoSQL/Trino和FlinkSQL。不同于非确定性的LLM-as-a-judge评分,每个任务在特定案例的隔离沙箱中执行,并由确定性的、基于规则的脚本评分。对16个前沿智能体的评估揭示了关键局限:最强模型仅获得74.9的总分,且没有单一模型占优——每个模型都在不同的引擎上各有所长,揭示出严格的领域专精化而非全能熟练。因此,自主数据工程仍然是一个艰巨的未解难题。我们在 https://github.com/Dicemy/DataClawEval/tree/master 发布数据集、容器化环境和确定性评测脚本。
