论文
超越Text-to-SQL:LLM真的能调试企业级ETL SQL吗?
Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?
摘要
SQL是企业数据工程的核心,然而一次性生成完全正确的SQL代码仍然困难,即使对有经验的开发者和先进的text-to-SQL LLM也是如此,往往需要多轮调试迭代。我们提出OurBench,首个面向企业级SQL推理与调试的基准。该基准建立在两项关键创新之上:(1)一个自动化构建工作流,利用逆向工程系统性地向大规模SQL代码注入真实缺陷,实现可扩展且多样的基准生成;(2)一个面向企业设置的无执行评估框架,提供快速、准确且节省资源的评估。OurBench包含469个OurBenchSyn查询(带有显式错误信息的语法错误)和516个OurBenchSem查询(针对代码无法满足用户意图的语义错误)。这些查询高度复杂,平均超过140行,并具有深而宽的抽象语法树。对近30个LLM的评估揭示了显著的性能差距:表现最好的模型Claude-4-Sonnet在OurBenchSyn上仅取得36.46%的准确率,OurBenchSem上为32.17%,而大多数模型得分低于20%。我们进一步探索四种解决策略,识别关键挑战,并概述了用LLM进行企业SQL调试的有前景方向。
