ESQ-Bench:用于评估NL2SQL方言泛化与静默语义偏差的多层级企业Oracle基准
ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence
摘要
最先进的自然语言转SQL(NL2SQL)模型在Spider和BIRD等既有基准上报告的执行准确率超过89%。然而,这些基准依赖简化的学术模式和开源SQL方言,不能反映企业数据库环境的复杂性。我们提出ESQ-Bench,一个以Oracle为先的NL2SQL基准,具有系统化的复杂度分层和跨三个企业模式复杂度层级的静默偏差评估。我们构建并发布了六个已填充数据的模式(465张表、164,682行、零空表),在Oracle、PostgreSQL、MySQL和SQL Server上使用相同的种子数据,以及一个四指标评测框架(EM、EX、SR、SD)和550个经金标准验证的问题-查询对(Tier-1:95;Tier-2:228;Tier-3:227)。使用模式关联提示的GPT-4o在各层级表现出单调的执行匹配退化:在已执行查询上的EX为79.8%、60.3%和57.2%(2026年6月),而在更早的142题试点切片上为75.6%、80.4%和95.8%。EM在全层级低于7%;在EX通过的查询中,运行层面的静默偏差达73%至99%。失败分析显示,在更高层级,“结果错误”的语义问题占主导。使用模式关联提示的Claude Sonnet 4.6达到87.4%、74.9%和68.7%的EX(已执行查询),在每个层级都超过GPT-4o模式关联。GPT-4o零样本在已执行查询上的EX(78.7%、73.5%和77.8%)在Tier 2至3反超模式关联提示,原因是零样本与模式关联对比分析中的执行率更低以及幸存者偏差。本地Llama 3.2模式关联在全库EX仅13.3%(550题中73题),凸显了闭源API模型与开源权重基线在企业Oracle模式上的差距。
