论文

超越Text-to-SQL:LLM真的能调试企业级ETL SQL吗?

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

模型评测基准与评测资源

摘要

SQL是企业数据工程的核心,然而一次性生成完全正确的SQL代码仍然困难,即使对有经验的开发者和先进的text-to-SQL LLM也是如此,往往需要多轮调试迭代。我们提出OurBench,首个面向企业级SQL推理与调试的基准。该基准建立在两项关键创新之上:(1)一个自动化构建工作流,利用逆向工程系统性地向大规模SQL代码注入真实缺陷,实现可扩展且多样的基准生成;(2)一个面向企业设置的无执行评估框架,提供快速、准确且节省资源的评估。OurBench包含469个OurBenchSyn查询(带有显式错误信息的语法错误)和516个OurBenchSem查询(针对代码无法满足用户意图的语义错误)。这些查询高度复杂,平均超过140行,并具有深而宽的抽象语法树。对近30个LLM的评估揭示了显著的性能差距:表现最好的模型Claude-4-Sonnet在OurBenchSyn上仅取得36.46%的准确率,OurBenchSem上为32.17%,而大多数模型得分低于20%。我们进一步探索四种解决策略,识别关键挑战,并概述了用LLM进行企业SQL调试的有前景方向。

超越Text-to-SQL:LLM真的能调试企业级ETL SQL吗?
图8:智能体化方法的概览,由一个主智能体、一个代码生成子智能体和一个 TQS 检查工具组成。主智能体观察错误消息与所发出的 SQL,分析失败原因及所需修改,并为代码生成子智能体生成代码编辑指令。代码生成子智能体按该指令修改代码;更新后的代码自动通过 TQS 检查器检测错误,产生的代码与 lint 反馈用于更新主智能体的记忆。该迭代循环持续进行,直到主智能体判定所有必要的修改均已完成。