论文

ELT-Bench-Verified:基准质量问题低估了 AI 智能体的能力

ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilities

智能体系统Agent任务评测

摘要

构建抽取-加载-转换(Extract-Load-Transform, ELT)流水线是一项劳动密集型的数据工程任务,也是 AI 自动化的高价值目标。在首个端到端 ELT 流水线构建基准 ELT-Bench 上,AI 智能体最初的成功率很低,表明它们缺乏实用价值。我们重新审视了这些结果,并找出导致智能体能力被大幅低估的两个因素。其一,使用升级后的大语言模型重新评估 ELT-Bench 发现,抽取与加载阶段已基本得到解决,而转换阶段的性能也显著提升。其二,我们开发了一套 Auditor-Corrector 方法论,将可扩展的 LLM 驱动根因分析与严格的人工校验(标注者间一致性 Fleiss' kappa = 0.85)相结合,用于审计基准质量。将该方法应用于 ELT-Bench 后发现,大多数失败的转换任务都包含可归因于基准的错误——包括僵化的评估脚本、含糊的规格说明和不正确的标准答案(ground truth)——这些错误惩罚了智能体的正确输出。基于这些发现,我们构建了 ELT-Bench-Verified,一个改进了评估逻辑并修正了标准答案的修订版基准。在该版本上重新评估带来了显著提升,且这一提升完全可归因于基准修正。我们的结果表明,模型的快速进步与基准质量问题共同导致了对智能体能力的低估。更广泛地说,我们的发现与文本到 SQL(text-to-SQL)基准中标注错误普遍存在的观察相呼应,表明质量问题在数据工程评估中是系统性的。系统化的质量审计应当成为复杂智能体任务的标准实践。我们发布 ELT-Bench-Verified,为 AI 驱动的数据工程自动化进展提供更可靠的基础。

ELT-Bench-Verified:基准质量问题低估了 AI 智能体的能力:论文配图
图 1. ELT-Bench 中 81 个失败转换任务的错误归因分布。任务按错误源(代理归因、基准归因或混合)进行分类,并按可缓解性进一步分层,区分可通过评估细化解决的错误与需要删除真实值列的错误。